
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文主要介绍了三个深度学习中的重要概念:1.交叉熵损失函数:从极大似然估计和信息论两个角度解释其原理,说明其作为分类任务损失函数的合理性;2.大模型生成参数:详细解析了top-k、top-p、temperature等参数的作用机制和协同应用顺序,以及beam search算法的实现原理;3.LoRA微调技术:阐述了其通过低秩分解减少训练参数量的原理,分析了rank和alpha参数的作用,并总结了该

本文系统介绍了大语言模型(LLM)的训练方法,主要包括三个关键环节:预训练、监督微调(SFT)和强化学习(PPO)。在预训练部分,详细讲解了从零训练和使用预训练模型两种方式,以及核心训练代码实现;在SFT环节,重点阐述了对话模板(Chat Template)、仅计算回答部分损失(Completions Only)和嵌入噪声(NEFT)三大技巧;最后深入解析了PPO强化学习训练,包括奖励模型训练、四

本文系统介绍了神经网络模型量化的原理与方法。首先阐述了量化的必要性,包括减少显存占用、提升计算速度等优势。详细讲解了对称量化和非对称量化的实现方式及差异,并演示了量化矩阵的计算过程。随后介绍了三种量化应用方案:训练后动态量化、静态量化以及量化感知训练,分析各自的优缺点。特别针对大模型提出了LLM.int8方法,通过分离处理异常特征解决传统量化精度下降问题。最后展示了HuggingFace中的实现方

本文介绍了模型量化的基本原理及GPTQ量化技术。量化通过将高精度浮点权重(如FP32)映射到低精度整数(如int8/int4)来压缩模型体积,主要分为训练时量化(QAT/QAF)和训练后量化(PTQ)。量化对象包括权重、激活值和梯度,其中权重量化最为常见。量化方法可分为均匀(uniform)和非均匀(non-uniform)映射、对称(symmetric)和非对称(asymmetric)量化。量化

GPTQ是一种经典的后训练量化算法,专为大规模预训练模型设计。它属于权重量化方法(weight-only),采用均匀量化方式,支持对称和非对称量化。GPTQ的创新点在于:1)通过统一量化顺序避免重复计算Hessian矩阵;2)采用分组量化策略减少显存带宽压力;3)使用Cholesky分解提高数值稳定性。相比OBQ算法,GPTQ显著提升了量化效率,能在不训练模型的情况下实现W3A16/W4A16的低

本文系统介绍了深度学习模型分布式训练的技术演进。首先分析了数据并行(DP)模式,指出其单进程多线程的局限性导致GPU0通信压力过大。然后详细讲解了DDP框架采用的ring all-reduce通信机制,通过环形连接实现负载均衡,使每个GPU的通信量恒定为2φ。进一步介绍了DeepSpeed的ZeRO优化方案:ZeRO-1通过划分优化器状态将显存占用降低至31.4GB;ZeRO-2增加梯度划分,显存

本文摘要:文章系统介绍了AI领域的多项关键技术。数据蒸馏部分阐述了三种核心方法(性能匹配、参数匹配、分布匹配),其中参数匹配效果最佳。Scaling Law部分解析了预训练、后训练和推理三个阶段的资源优化法则。RAG准确率提升提出了三种改进方法:智能分词、语义校验和混合检索。大模型训练流程详细说明了数据清洗、预训练、指令微调和偏好对齐四个关键步骤。显存估算部分则从推理和训练两个维度,以7B模型为例
本文探讨了CLIP和MoCo两种突破性模型。CLIP通过图文配对训练实现了无需标注数据的多模态学习,利用prompt技术摆脱了传统分类模型的固定类别限制,开创性地将文本与图像特征映射到共享向量空间。MoCo作为对比学习算法,通过动量编码器和负样本队列解决了无监督学习中样本一致性问题,采用指数移动平均更新策略稳定训练过程。两者共同特点是:1)减少人工标注依赖;2)通过自监督学习提取高质量特征表示;3

ALBEF是一种先进的多模态学习模型,通过图像-文本对比学习实现模态对齐。其核心创新包括:1) 采用不对称编码结构,图像编码器(ViT)比文本编码器(BERT)更深;2) 引入动量模型增强特征对比学习;3) 设计多模态融合模块,通过跨模态注意力机制实现深度交互;4) 提出动量蒸馏技术,利用KL散度减少噪声数据影响。该模型通过图像-文本对比(ITC)、匹配(ITM)和掩码语言建模(MLM)三个任务联

本文介绍了4bit量化参数配置及其在神经网络中的应用。首先解释了NF4(Normal Float 4)量化方法,该方法基于正态分布特性,在数值密集区域分配更多量化值以减少误差。量化过程包含归一化、查表映射等步骤,并保留scale值用于反量化。针对QLoRA技术,提出了分块量化和双重量化方案:将64个值作为一块独立量化,再对多个块的scale值进行8bit二次量化,使额外显存占用从12.5%降至3.








