• SFT 是“师傅手把手教徒弟”,让模型学会基本技能和规范。

  • GRPO 是“让徒弟参加比武大会”,通过与其他学徒对比,在实战中自我精进,形成自己的风格和更强的能力。


一、 监督微调

监督微调是大模型从“通才”走向“专才”的关键第一步。

1. 核心目标

将预训练得到的、拥有通用语言知识但“不懂规矩”的基座模型,微调成一个能理解并遵循人类指令、以对话形式进行交互的助手模型。

2. 工作原理与过程
  • 输入数据:高质量的指令-回答对 数据集。

    • 指令:“用Python写一个函数,计算斐波那契数列。”

    • 回答:“def fibonacci(n): ...” (一个标准、正确的代码示例)

  • 训练过程:这是一个标准的有监督学习过程。

    • 将指令输入模型,让模型生成回答。

    • 将模型的生成结果与标准答案进行对比。

    • 通过计算交叉熵损失,反向传播更新模型参数,让模型的输出尽可能接近我们提供的标准答案。

  • 一个比喻:就像教一个已经掌握大量词汇(预训练)的学生写八股文。我们给他大量的范文(SFT数据),告诉他对于不同的题目(指令),应该用什么结构、什么风格来回答。他通过模仿这些范文,学会了“答题的格式和套路”。

3. 作用与价值
  • 激发能力:预训练模型已经“偷偷”学会了很多知识和技能,但不知道如何调用。SFT像一个开关,激活了模型在预训练阶段获得但未被明确指引的能力

  • 学习格式:教会模型遵循对话格式,比如以“作为一名AI助手...”开头,或者正确理解“总结上文”这样的指令。

  • 对齐初步:让模型的输出风格开始与人类的偏好进行初步对齐,比如变得更 helpful、harmless 和 honest。

4. 局限性

SFT模型本质上是“模仿大师”,但它:

  • 缺乏真正的“理解”和“判断”:它不知道自己的回答为什么好,也不知道还有没有更好的回答方式。

  • 容易过拟合:如果数据不够多样,模型可能会机械地复制训练数据中的回答,缺乏创造性和泛化能力。

  • 存在“模仿天花板”:其性能上限受制于收集到的人工标注数据的质量和数量。

为了解决SFT的局限性,我们需要进入下一个阶段——强化学习,而GRPO正是为此而生的一种高效方法。


二、 群体相对策略优化

GRPO是DeepSeek提出的一种无需训练额外奖励模型的强化学习算法,是其在技术路径上区别于OpenAI等公司的一个显著特征。

1. 核心目标

在SFT的基础上,进一步优化模型,使其输出不仅正确,而且更符合人类复杂、微妙的偏好(如更有逻辑、更富有创造力、更安全等)。

2. 工作原理与过程

与传统强化学习方法(如PPO)需要先训练一个独立的奖励模型不同,GRPO直接利用一组回答之间的相对优劣来进行优化。

其工作流程可以分解为以下几个关键步骤,下图清晰地展示了这一过程:

详细步骤解析:

  • 步骤1:生成回答群体:对于同一个提示(如一个数学题),让当前的模型生成多个(例如4个)不同的回答(A, B, C, D)。

  • 步骤2:群体评分:由人类标注者或一个强大的AI裁判(比如GPT-4),为这一组回答进行评分。评分不是绝对的,而是相对的。例如,A > B > C > D。

  • 步骤3:计算相对优势:GRPO的核心创新点在于,它不需要一个训练好的、能给出绝对分数的奖励模型(RM)。取而代之的是,它直接利用当前这组回答内部的相对排名,计算出一个优势函数。这个优势函数衡量的是某个回答相对于本组回答平均水平的优越程度

  • 步骤4:策略梯度更新:使用计算出的优势函数,通过策略梯度算法来更新模型。

    • 对于排名靠前的回答(如A和B),模型会增加生成这类回答的概率。

    • 对于排名靠后的回答(如C和D),模型会降低生成这类回答的概率。

  • 一个比喻:就像一场“盲审”作文比赛。评委不看作者,只对一组文章进行排序。然后告诉所有参赛者:“排名第一的文章风格是大家应该学习的,排名最后的风格是需要避免的。” 参赛者(模型)通过这种群体内的对比,而不是一个绝对的分数,来领悟什么是“好文章”,并据此调整自己的写作风格。

3. 优势与价值
  • 省去RM训练成本:免去了训练一个独立且昂贵的奖励模型的步骤,简化了整个强化学习流程,降低了计算开销。

  • 更稳定的训练:依赖于一组回答的相对排名,比依赖一个可能不准确的RM给出的绝对分数更为鲁棒,减少了训练的不稳定性。

  • 鼓励多样性:由于是在一组回答中进行比较,模型为了“胜出”,会倾向于探索更多样、更优质的输出方式,而不是收敛到单一模式。

  • 专注于核心能力:对于DeepSeek-R1这种专注于推理的模型,GRPO可以很好地引导模型优化其思维链的清晰度、逻辑的严谨性和步骤的完整性,因为这些特质通常会被人类评判者认为是更优的。

总结:SFT 与 GRPO 的协同

特性 监督微调 群体相对策略优化
角色 启蒙老师 竞技教练
方法 模仿学习 对比学习
数据 指令-标准答案对 提示-回答组-排名对
目标 学会基本指令遵循 输出质量超越模仿,更符合复杂偏好
关键创新 / 无需训练奖励模型,利用群体内相对优势

简而言之,SFT为模型打下了坚实的基础并建立了基本的行为规范,而GRPO则在此基础上,通过一种更高效、更稳定的“内部比武”机制,激发模型的潜力,使其输出提升到更高的水平。 这两者结合,共同构成了DeepSeek模型实现卓越性能的关键训练路径。

更多推荐