大模型强化学习
·
PPO的四个核心模块
策略模型
主要负责根据当前提示生成token。PPO的“剪切”目标函数直接对它的参数做梯度下降,让奖励高的序列概率上升、低奖励序列的概率下降。这是PPO唯一更新的语言模型。
价值模型
和策略模型一样的回归头,用来估计“当前前缀状态下,未来能获得的累计奖励”的期望。他给每条token提供baseline,用于计算优势A,从而剑侠策略梯度方差。训练师最小化TD或GAE目标和预测值之间的MSE。
奖励模型
固定不变,专门给完整回答打分。把人类偏好转化成可导的标量信号,目标来源。
参考模型
通常是RLHF开始前的SFT检查点,参数冻结,用来计算KL三都,防止策略模型偏离原始模型过远。
DPO做了什么改进
DPO 的核心思想是将强化学习转化为偏好分类问题:直接用人类标注的 "好回答" 和 "差回答" 训练模型,跳过 PPO 中复杂的奖励模型和强化学习循环。
1. 无需奖励模型
2. 训练流程极简
GRPO:用“多次模拟平均值”替代价值函数
为了减少计算成本,GRPO提出一个新方法:
- 让我们先进行五次模拟考试,计算平均分数作为新基准。
- 如果实际考试成绩超过该基准,则给予奖励。
GRPO 采用类似思路,在 LLM 训练中:
- 不再使用 Critic 价值模型。
- 针对相同输入,采样多个输出,计算平均奖励。
- 保留 PPO 的裁剪和 KL 机制,确保稳定更新。
更多推荐
所有评论(0)