PPO的四个核心模块

策略模型

主要负责根据当前提示生成token。PPO的“剪切”目标函数直接对它的参数做梯度下降,让奖励高的序列概率上升、低奖励序列的概率下降。这是PPO唯一更新的语言模型。

价值模型

和策略模型一样的回归头,用来估计“当前前缀状态下,未来能获得的累计奖励”的期望。他给每条token提供baseline,用于计算优势A,从而剑侠策略梯度方差。训练师最小化TD或GAE目标和预测值之间的MSE。

奖励模型

固定不变,专门给完整回答打分。把人类偏好转化成可导的标量信号,目标来源。

参考模型

通常是RLHF开始前的SFT检查点,参数冻结,用来计算KL三都,防止策略模型偏离原始模型过远。

DPO做了什么改进

DPO 的核心思想是将强化学习转化为偏好分类问题:直接用人类标注的 "好回答" 和 "差回答" 训练模型,跳过 PPO 中复杂的奖励模型和强化学习循环。

1. 无需奖励模型

2. 训练流程极简

GRPO:用“多次模拟平均值”替代价值函数

为了减少计算成本,GRPO提出一个新方法:

  • 让我们先进行五次模拟考试,计算平均分数作为新基准。
  • 如果实际考试成绩超过该基准,则给予奖励。

GRPO 采用类似思路,在 LLM 训练中:

  • 不再使用 Critic 价值模型
  • 针对相同输入,采样多个输出,计算平均奖励
  • 保留 PPO 的裁剪和 KL 机制,确保稳定更新。

更多推荐