
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
│ 大模型训练三阶段全景图 ││ ││ 第一阶段:预训练(Pre-training) ││ ├─ 目标:学会预测下一个词(完形填空) ││ ├─ 数据:万亿级Token(网页、书籍、代码) ││ ├─ 成本:数千万美元,数千GPU ││ └─ 产出:基座模型(能续写,但不会好好对话) ││ │ ││ ▼ ││ 第二阶段:监督微调(SFT) ││ ├─ 目标:学会按要求回答问题(问答培训) ││ ├
Tokenizer是大模型的"文字入口",它决定了模型看到的不是一个一个的字或词,而是一串数字ID。大模型不直接读文字,必须通过Tokenizer将文本转换为token ID序列子词切分是现代Tokenizer的主流方案,在词表大小和表达能力之间取得平衡BPE是最经典的子词算法,核心就是不断合并高频相邻字符对WordPiece和SentencePiece是BPE的变体,核心思路类似但策略和适用范围
Prefill + Decode 两阶段:像考试一样,先审题(并行处理),再写答案(逐字生成)。KV Cache:像草稿纸一样缓存中间结果,避免重复计算,是加速的基石。模型量化:像图片压缩一样缩小模型体积,INT4 量化让大模型在消费级显卡上也能跑。:减少"搬运数据"的次数,让注意力计算快好几倍。投机解码:小助理写草稿、老板审核,用并行换速度,质量不打折。批处理:让多个用户共享 GPU,Conti
位置编码虽然是Transformer中的"小模块",但解决的是模型理解序列的根本性问题。Sinusoidal用数学函数给每个位置生成"指纹",优雅但表达力有限;可学习编码让模型自己学位置,灵活但受限于训练长度;RoPE通过旋转设计让位置信息天然融入注意力计算,成为当前最优解;长文本扩展(NTK Scaling、YaRN等)解决了RoPE的外推短板。对开发者来说,RoPE是当前大模型位置编码的基础方
预训练模型 + 你的数据 = 你的专属模型大模型在训练时已经"读"了海量互联网文本,具备很强的通用能力。但如果你想让它做特定领域的事情——比如当客服机器人、写医疗报告、生成法律合同——通用模型就不太够用了。微调就是拿一个已经训练好的模型,再用你自己准备的数据继续训练它,让它学会你的"行话"和"规矩"。就好比一个什么都会的实习生,你给他一些业务文档和案例培训几天,他就能上手干活了。LoRA已经成为微
互联网原始数据(万亿Token级别)↓数据预处理(去重、过滤、去毒、配比)↓模型训练(数千张GPU × 数周,做Next Token Prediction)↓基座模型(Base Model)——知识丰富,但只会续写,不会对话↓后续训练(SFT + RLHF)→ 对话助手(如ChatGPT)预训练的本质,就是用"猜下一个词"这个看似简单的任务,逼迫模型从海量文本中习得人类语言的规律和世界知识。它是大
来回顾一下今天的核心知识点:要点内容SFT解决什么问题让预训练模型从"文字续写"变成"指令回答"核心思路用带标准答案的指令数据做有监督微调训练关键只在output部分计算loss,不关注instruction部分数据策略质量远重于数量,1000条精选数据 > 10万条粗糙数据SFT的局限只教了模型"回答",没教它"回答得好"——需要RLHF预训练(学知识)→ SFT(学回答)→ RLHF(学好回答
预训练数据是大模型的知识基础,需要经过严格的清洗和去重,数据来源要多样化。数据配比决定了模型能力的"方向",需要大量实验来确定最佳配方。SFT 指令数据质量远比数量重要,1000 条精品数据可能胜过 10 万条平庸数据。偏好数据的标注一致性直接影响 RLHF/DPO 的训练效果。数据污染、偏见和版权是数据工程中的三大"暗礁",必须提前防范。在大模型的世界里,数据不是"越多越好",而是"越精越好"。
分布式训练是大模型训练的基础设施级技术,核心思路就是"拆":策略拆什么适用场景数据并行拆数据模型能放进单卡张量并行拆每一层单层太大,同机器内流水线并行拆不同层模型整体太大,跨机器ZeRO拆冗余状态减少数据并行的显存浪费实际工程中,通常是多种策略的组合。对于大多数开发者来说,已经能覆盖 7B~13B 模型的训练需求;如果你要训练更大的模型,就需要深入了解 3D 并行了。下一篇我们将聊训练优化技巧。
如果你只记住一个优化器,那就是AdamW。它是目前几乎所有大模型预训练和微调的默认选择。AdamW = Adam + 解耦权重衰减(Decoupled Weight Decay)。Adam给每个参数维护独立的"学习速度",聪明的参数学得快,笨的参数学得慢权重衰减相当于给参数加了一个"拉力",防止它们变得太大(正则化效果)两者结合,既保证训练速度快,又保证模型不会过拟合。恭喜你!到这里,第二周"大模







