标签大模型 人工智能 LLM RLHF DPO 微调
摘要:满屏的 SFT、RLHF、DPO 让你似懂非懂?本文用“毕业生上班”的通俗类比,一次性讲透大模型从预训练、微调到对齐的完整成长路线,帮你彻底理顺核心技术概念。


在这里插入图片描述

最近在梳理AI的时候,发现有些术语是20前没注意到的,今天来整理一下。

其实LLM与我们个人的成长很像:

  • 9年义务+高中就像是预训练,进行通识教育。
  • 大学阶段就是进行微调,按专业调整能力。
  • 进入社会了就得与社会规则进行适应,也就是对齐

一句话先记住:预训练让模型“有知识”,SFT 让模型“会接任务”,RLHF 或 DPO 让模型“懂分寸”。
在这里插入图片描述

现在各种不明觉厉的缩写太多了:SFTRLHFDPOAlignmentPPO,每个词都像懂了,又没完全懂。这次就顺着“大模型成长”这条线,把这些概念一次讲顺。

一、预训练:海量阅读,让 AI 先“学会表达”

本节关键词:自监督学习、自回归、基础模型

预训练是大模型的第一阶段人生。这个阶段数据量极大,网页、书籍、论文、代码,能喂的都喂;人工标注极少。它的核心目标很朴素:打好语言规律、逻辑和常识的底子。

它最典型的任务是“看上文,猜下文”。就像小时候做的句子接龙,模型逐字预测下一个 token,在猜测中摸清词汇搭配、句子衔接和常识逻辑。这条路线的正式名字叫自回归语言建模(Autoregressive Language Modeling),GPT 系列正是由此起家。

更核心的术语是自监督学习(Self-supervised Learning)。

有人说预训练“不需要人工打标签”,这容易被误解为“没有监督信号”。其实不然。预训练是模型直接从原始文本给自己出题、找答案。比如把后半句盖住,让它猜。题目和答案都在数据里,无需人工逐条标注,这种“自己考自己”的方式就是自监督学习。

预训练结束时,模型已经能写出通顺的文字,具备常识和推理雏形。但它还不够“听话”:让它写周报,它可能回你一篇散文;让它列步骤,它可能长篇大论。这个“有知识、但不按规矩办事”的版本,叫基础模型(Foundation Model / Base Model),也称基座模型。

把它想象成一个刚读完很多书的毕业生就行:知识储备够了,但还没学会怎么在岗位上按标准交付。

二、微调与对齐:让 AI 不只会说,还要会按要求说

本节关键词:SFT、对齐

基础模型不会听话怎么办?要给它上“岗位培训”。这一步就是微调。

微调最常见的起点,是监督微调(SFT,Supervised Fine-Tuning)。它的训练数据长这样:

问:帮我写一封请假邮件
答:一封格式完整、语气得体的请假邮件

模型看多了这种“指令 + 标准回答”的配对数据,自然会建立反射:人类抛出任务,我该用什么结构和语气回应。

这里必须区分两个“监督”:

  • 预训练是自监督:题目和答案自动从数据里提取。
  • SFT 是监督学习:每条数据都由人类提供示范答案。

SFT 让模型变得像个“接单熟手”,但这并不意味着它绝对可靠。“按要求回答”不等于“回答得合适”。

于是我们需要对齐(Alignment)。

比如问“怎么开锁”,模型若老老实实给出撬锁步骤,说明它听懂了任务,但显然违背了安全底线。对齐解决的不是“会不会答”,而是:

  • 什么问题该答?
  • 什么问题不该答?
  • 怎样答才真正有帮助、安全且符合偏好?

所以,对齐是总目标:让模型的行为有用、无害、符合人类偏好。至于怎么实现,RLHF 是一条路,DPO 是另一条。

三、对齐的两条主路:RLHF 和 DPO

本节关键词:RLHF、奖励模型、PPO、DPO

在这里插入图片描述

先看经典做法:RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。

它大致分三步:

  1. 给同一个问题配多个回答,让人工标注“哪个更好”。
  2. 用这些标注训练一个打分器,即奖励模型(Reward Model)。
  3. 用强化学习算法推动大模型输出高分回答,最常用的是 PPO(Proximal Policy Optimization)。

这套流程虽然直观,但链条长、组件多、调参成本高。模型生成回答,奖励模型给分,PPO 再根据分数更新策略——整个过程是动态联动的,极其脆弱。

打个比方,RLHF 像“老师坐旁边批改做题”:你写一题,老师现场打分,你根据分数改下一题。

再看现在的绝对主流:DPO(Direct Preference Optimization,直接偏好优化)。

DPO 的目标与 RLHF 无异,都是对齐人类偏好。但它大幅压缩了流程:跳过奖励模型和 PPO,直接拿“好回答 vs 差回答”的数据去训练模型。

结果显而易见:没有打分器,没有强化学习更新,训练回归到常规的监督学习,更稳定、更省事。今天绝大多数开源与商用模型,都默认采用 DPO 或其变体。

为了更直观,你也可以看这个对比表:

方法核心输入中间环节训练特征直观理解
RLHF人类偏好数据奖励模型 + PPO链条更长,动态更强老师现场盯着你改
DPO人类偏好数据直接写进损失函数流程更短,更像监督训练拿着好坏案例反复练

四、DPO 深入:没有打分器,梯度从哪来?

本节关键词:损失函数、反向传播、输出概率

你肯定会问:DPO 不要奖励模型了,训练信号从哪来?模型靠什么反向传播?

答案是:DPO 没丢掉训练信号,它把信号折叠进了损失函数。

在 RLHF 里,信号链条是:
偏好数据 -> 奖励模型 -> 奖励分数 -> PPO 更新 -> 参数变化

在 DPO 里,思路变成了:
偏好数据 -> 好差回答的概率差 -> 形成损失 -> 反向传播

核心逻辑很简单:模型本来就会给不同回答分配概率。“更符合偏好”的回答应该拿高概率,“更差”的回答该被压低。DPO 直接利用这个概率差来优化,不需要外部打分器中转。

换句话说,RLHF 靠外部老师给分纠正;DPO 是把“好坏对比”直接写进试卷的评分规则,模型自己按规则算梯度。这也是为什么大家说 DPO 更像“换了损失函数的 SFT”。

五、DPO 的反馈是实时的吗?

本节关键词:离线偏好数据、偏好对

不是。DPO 常用的是离线偏好数据

训练开始前,我们要准备一批三元组数据:

  • 同一个问题
  • 一个较好的回答
  • 一个较差的回答

这些数据由人工标注或算法筛选得到。整理成固定数据集后,再喂给模型。这意味着,DPO 训练时并没有人守在旁边打分,模型也不需要一边生成一边等反馈。

这一点很容易和 RLHF 混淆:

  • RLHF 的原始偏好数据通常也是预先收集的。
  • 但在 PPO 阶段,RLHF 会把“生成、打分、更新”放进训练循环里。
  • DPO 直接砍掉了这段联动,只做离线偏好优化。

一句话概括:

DPO 不是“边练边听人类反馈”,而是“把偏好固化成数据,再拿去离线训练”。

六、最后理一遍:对齐、强化学习、SFT 到底是什么关系?

本节关键词:对齐、强化学习、RLHF、DPO、SFT

在这里插入图片描述

到了这里,最容易混淆的概念层级,你应该已经理顺了:

  • 对齐是目标:让模型有用、安全、符合人类偏好。
  • 强化学习是手段:核心是“试错 + 奖励”。
  • RLHF 是“用强化学习做对齐”。
  • DPO 是“不用强化学习做对齐”。
  • SFT 是“先把指令能力练出来”,它是最基础的对齐。

对应成直白的公式:

  • RLHF = 强化学习 + 对齐
  • DPO = 监督学习 + 对齐
  • SFT = 监督学习 + 基础指令对齐

所以,对齐和强化学习不在一个层级。对齐回答“想要什么”,强化学习回答“怎么做”。

沿用“毕业生上班”的比喻:

  • 预训练:让他读很多书,打基础。
  • SFT:做岗位训练,教他按要求交付。
  • RLHF:让他在实习中边做边拿反馈。
  • DPO:给他一套“好坏对照手册”,让他照着练。

收尾

大模型从“上学”到“上班”的路径就是这么清晰:

  • 预训练打底:通过自监督学习获得知识与逻辑。
  • SFT 塑能力:通过带答案的数据学会按指令作答。
  • RLHF 或 DPO 修分寸:通过偏好对齐让模型贴近真实需求。

下次再看到这些术语,在脑子里翻译一下:

  • 预训练:先读书。
  • SFT:上专项课。
  • RLHF / DPO:做职场礼仪培训。

缩写再多,你也不会迷路了。

热点术语速查

术语全称一句话记住
自监督学习Self-supervised Learning预训练的核心方法,模型自己给自己出题
自回归建模Autoregressive Language Modeling按顺序预测下一个 token,是 GPT 的典型路线
基础模型Foundation Model / Base Model预训练后的成品,有知识但还不够听话
SFTSupervised Fine-Tuning监督微调,用“指令 + 标准答案”教模型按要求回答
对齐Alignment让 AI 更有用、更安全、更符合人类偏好,这是目标
奖励模型Reward ModelRLHF 里的打分器,把“好坏”翻译成分数
PPOProximal Policy OptimizationRLHF 常用的强化学习优化算法
RLHFReinforcement Learning from Human Feedback用强化学习结合人类反馈来做对齐
DPODirect Preference Optimization直接用偏好数据优化模型,省掉奖励模型和 PPO
损失函数Loss Function把“模型该往哪里调”变成可计算训练信号的函数

更多推荐