大模型成长全攻略:从“上学”到“上班”,那些你必须搞懂的词
标签:
大模型人工智能LLMRLHFDPO微调
摘要:满屏的 SFT、RLHF、DPO 让你似懂非懂?本文用“毕业生上班”的通俗类比,一次性讲透大模型从预训练、微调到对齐的完整成长路线,帮你彻底理顺核心技术概念。
文章目录

最近在梳理AI的时候,发现有些术语是20前没注意到的,今天来整理一下。
其实LLM与我们个人的成长很像:
- 9年义务+高中就像是预训练,进行通识教育。
- 大学阶段就是进行微调,按专业调整能力。
- 进入社会了就得与社会规则进行适应,也就是对齐
一句话先记住:预训练让模型“有知识”,SFT 让模型“会接任务”,RLHF 或 DPO 让模型“懂分寸”。
现在各种不明觉厉的缩写太多了:SFT、RLHF、DPO、Alignment、PPO,每个词都像懂了,又没完全懂。这次就顺着“大模型成长”这条线,把这些概念一次讲顺。
一、预训练:海量阅读,让 AI 先“学会表达”
本节关键词:自监督学习、自回归、基础模型
预训练是大模型的第一阶段人生。这个阶段数据量极大,网页、书籍、论文、代码,能喂的都喂;人工标注极少。它的核心目标很朴素:打好语言规律、逻辑和常识的底子。
它最典型的任务是“看上文,猜下文”。就像小时候做的句子接龙,模型逐字预测下一个 token,在猜测中摸清词汇搭配、句子衔接和常识逻辑。这条路线的正式名字叫自回归语言建模(Autoregressive Language Modeling),GPT 系列正是由此起家。
更核心的术语是自监督学习(Self-supervised Learning)。
有人说预训练“不需要人工打标签”,这容易被误解为“没有监督信号”。其实不然。预训练是模型直接从原始文本给自己出题、找答案。比如把后半句盖住,让它猜。题目和答案都在数据里,无需人工逐条标注,这种“自己考自己”的方式就是自监督学习。
预训练结束时,模型已经能写出通顺的文字,具备常识和推理雏形。但它还不够“听话”:让它写周报,它可能回你一篇散文;让它列步骤,它可能长篇大论。这个“有知识、但不按规矩办事”的版本,叫基础模型(Foundation Model / Base Model),也称基座模型。
把它想象成一个刚读完很多书的毕业生就行:知识储备够了,但还没学会怎么在岗位上按标准交付。
二、微调与对齐:让 AI 不只会说,还要会按要求说
本节关键词:SFT、对齐
基础模型不会听话怎么办?要给它上“岗位培训”。这一步就是微调。
微调最常见的起点,是监督微调(SFT,Supervised Fine-Tuning)。它的训练数据长这样:
问:帮我写一封请假邮件
答:一封格式完整、语气得体的请假邮件
模型看多了这种“指令 + 标准回答”的配对数据,自然会建立反射:人类抛出任务,我该用什么结构和语气回应。
这里必须区分两个“监督”:
- 预训练是自监督:题目和答案自动从数据里提取。
- SFT 是监督学习:每条数据都由人类提供示范答案。
SFT 让模型变得像个“接单熟手”,但这并不意味着它绝对可靠。“按要求回答”不等于“回答得合适”。
于是我们需要对齐(Alignment)。
比如问“怎么开锁”,模型若老老实实给出撬锁步骤,说明它听懂了任务,但显然违背了安全底线。对齐解决的不是“会不会答”,而是:
- 什么问题该答?
- 什么问题不该答?
- 怎样答才真正有帮助、安全且符合偏好?
所以,对齐是总目标:让模型的行为有用、无害、符合人类偏好。至于怎么实现,RLHF 是一条路,DPO 是另一条。
三、对齐的两条主路:RLHF 和 DPO
本节关键词:RLHF、奖励模型、PPO、DPO

先看经典做法:RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。
它大致分三步:
- 给同一个问题配多个回答,让人工标注“哪个更好”。
- 用这些标注训练一个打分器,即奖励模型(Reward Model)。
- 用强化学习算法推动大模型输出高分回答,最常用的是 PPO(Proximal Policy Optimization)。
这套流程虽然直观,但链条长、组件多、调参成本高。模型生成回答,奖励模型给分,PPO 再根据分数更新策略——整个过程是动态联动的,极其脆弱。
打个比方,RLHF 像“老师坐旁边批改做题”:你写一题,老师现场打分,你根据分数改下一题。
再看现在的绝对主流:DPO(Direct Preference Optimization,直接偏好优化)。
DPO 的目标与 RLHF 无异,都是对齐人类偏好。但它大幅压缩了流程:跳过奖励模型和 PPO,直接拿“好回答 vs 差回答”的数据去训练模型。
结果显而易见:没有打分器,没有强化学习更新,训练回归到常规的监督学习,更稳定、更省事。今天绝大多数开源与商用模型,都默认采用 DPO 或其变体。
为了更直观,你也可以看这个对比表:
| 方法 | 核心输入 | 中间环节 | 训练特征 | 直观理解 |
|---|---|---|---|---|
| RLHF | 人类偏好数据 | 奖励模型 + PPO | 链条更长,动态更强 | 老师现场盯着你改 |
| DPO | 人类偏好数据 | 直接写进损失函数 | 流程更短,更像监督训练 | 拿着好坏案例反复练 |
四、DPO 深入:没有打分器,梯度从哪来?
本节关键词:损失函数、反向传播、输出概率
你肯定会问:DPO 不要奖励模型了,训练信号从哪来?模型靠什么反向传播?
答案是:DPO 没丢掉训练信号,它把信号折叠进了损失函数。
在 RLHF 里,信号链条是:
偏好数据 -> 奖励模型 -> 奖励分数 -> PPO 更新 -> 参数变化
在 DPO 里,思路变成了:
偏好数据 -> 好差回答的概率差 -> 形成损失 -> 反向传播
核心逻辑很简单:模型本来就会给不同回答分配概率。“更符合偏好”的回答应该拿高概率,“更差”的回答该被压低。DPO 直接利用这个概率差来优化,不需要外部打分器中转。
换句话说,RLHF 靠外部老师给分纠正;DPO 是把“好坏对比”直接写进试卷的评分规则,模型自己按规则算梯度。这也是为什么大家说 DPO 更像“换了损失函数的 SFT”。
五、DPO 的反馈是实时的吗?
本节关键词:离线偏好数据、偏好对
不是。DPO 常用的是离线偏好数据。
训练开始前,我们要准备一批三元组数据:
- 同一个问题
- 一个较好的回答
- 一个较差的回答
这些数据由人工标注或算法筛选得到。整理成固定数据集后,再喂给模型。这意味着,DPO 训练时并没有人守在旁边打分,模型也不需要一边生成一边等反馈。
这一点很容易和 RLHF 混淆:
- RLHF 的原始偏好数据通常也是预先收集的。
- 但在 PPO 阶段,RLHF 会把“生成、打分、更新”放进训练循环里。
- DPO 直接砍掉了这段联动,只做离线偏好优化。
一句话概括:
DPO 不是“边练边听人类反馈”,而是“把偏好固化成数据,再拿去离线训练”。
六、最后理一遍:对齐、强化学习、SFT 到底是什么关系?
本节关键词:对齐、强化学习、RLHF、DPO、SFT

到了这里,最容易混淆的概念层级,你应该已经理顺了:
- 对齐是目标:让模型有用、安全、符合人类偏好。
- 强化学习是手段:核心是“试错 + 奖励”。
- RLHF 是“用强化学习做对齐”。
- DPO 是“不用强化学习做对齐”。
- SFT 是“先把指令能力练出来”,它是最基础的对齐。
对应成直白的公式:
RLHF = 强化学习 + 对齐DPO = 监督学习 + 对齐SFT = 监督学习 + 基础指令对齐
所以,对齐和强化学习不在一个层级。对齐回答“想要什么”,强化学习回答“怎么做”。
沿用“毕业生上班”的比喻:
- 预训练:让他读很多书,打基础。
- SFT:做岗位训练,教他按要求交付。
- RLHF:让他在实习中边做边拿反馈。
- DPO:给他一套“好坏对照手册”,让他照着练。
收尾
大模型从“上学”到“上班”的路径就是这么清晰:
- 预训练打底:通过自监督学习获得知识与逻辑。
- SFT 塑能力:通过带答案的数据学会按指令作答。
- RLHF 或 DPO 修分寸:通过偏好对齐让模型贴近真实需求。
下次再看到这些术语,在脑子里翻译一下:
- 预训练:先读书。
- SFT:上专项课。
- RLHF / DPO:做职场礼仪培训。
缩写再多,你也不会迷路了。
热点术语速查
| 术语 | 全称 | 一句话记住 |
|---|---|---|
| 自监督学习 | Self-supervised Learning | 预训练的核心方法,模型自己给自己出题 |
| 自回归建模 | Autoregressive Language Modeling | 按顺序预测下一个 token,是 GPT 的典型路线 |
| 基础模型 | Foundation Model / Base Model | 预训练后的成品,有知识但还不够听话 |
| SFT | Supervised Fine-Tuning | 监督微调,用“指令 + 标准答案”教模型按要求回答 |
| 对齐 | Alignment | 让 AI 更有用、更安全、更符合人类偏好,这是目标 |
| 奖励模型 | Reward Model | RLHF 里的打分器,把“好坏”翻译成分数 |
| PPO | Proximal Policy Optimization | RLHF 常用的强化学习优化算法 |
| RLHF | Reinforcement Learning from Human Feedback | 用强化学习结合人类反馈来做对齐 |
| DPO | Direct Preference Optimization | 直接用偏好数据优化模型,省掉奖励模型和 PPO |
| 损失函数 | Loss Function | 把“模型该往哪里调”变成可计算训练信号的函数 |
更多推荐

所有评论(0)