Take-away Messages
  • RL
    • Agent, Environment
    • State, Action, Reward
    • Policy Iteration, Value Iteration
    • No transition matrix Sampling
    • No policy function DL
  • RLHF
    • Actor Model, Reference Model, Reward Model, Critic Mode

第一部分:强化学习基础框架

强化学习是机器学习的三大分支之一,其最大特点是训练极度不稳定、对初始化极度敏感。理解 RL 可以代入“人打电动游戏”的场景。

1. 两大核心主体

  • 决策主体 (Agent):执行动作的单元(如:打游戏的玩家)。
  • 交互环境 (Environment):给定规则的外部世界(如:游戏厂商设定的地图、小怪、吃金币规则)。

2. 马尔可夫决策过程 (MDP) 五元组

MDP 是强化学习的严谨数学建模,包含五个核心变量 $(S, A, P, R, \gamma)$:

  • $S$ (State / 状态):环境呈现给 Agent 的客观情况(如:屏幕上金币的位置、当前的积分)。
  • $A$ (Action / 行动):Agent 主观选择的操作(如:上下左右、跳跃)。
  • $P$ (Transition Probability / 转移概率矩阵):环境规则。执行动作后,下一时刻状态发生变化的概率($S_t \xrightarrow{A_t} S_{t+1}$)。
  • $R$ (Reward / 奖励):环境给出的即时反馈(如:吃到金币 +1,吃到毒蘑菇 -1)。
  • $\gamma$ (Discount Factor / 折现因子):时间价值。未来的奖励折算到当前的比例。

终极目标:寻找一个最优策略 (Policy, $\pi$),即在任何状态下该做出什么行动,从而最大化未来的累计总收益

第二部分:值函数与求解思想

1. 两个核心价值函数

  • Value Function ($v^\pi(s)$)状态价值函数。给定策略 $\pi$ 下,站在当前状态 $s$,未来能获得的所有累计奖励的期望。
  • Q-function ($q^\pi(s, a)$)动作价值函数。站在状态 $s$,已经强制执行了动作 $a$,此后遵循策略 $\pi$ 能获得的未来累计奖励的期望。

2. 贝尔曼方程 (Bellman Equation)

描述当前状态价值与下一时刻状态价值之间的递归等式关系。

  • 最优化结论:通过将贝尔曼方程转化为线性规划问题,可知最优策略 ($\pi^*$) 必然是确定性策略 (Deterministic)(即在线性规划的顶点取得最值,而非概率切分)。

3. 两种经典求解迭代思想

  • 策略迭代 (Policy Iteration):基于当前策略算出 Value,再根据 Value 更新策略,交替进行。对应普通的 Bellman Equation。
  • 值迭代 (Value Iteration):利用最优策略是确定性的特点,每一步迭代直接取 Max 动作,更新更快。对应 Bellman Optimal Equation。

4. 现实问题与解决方案(机器学习的引入)

  • 问题 1:不知道环境转移概率 $P$ 怎么办?
    • 解法采样 (Sampling) 与 时序差分 (TD)。不用蒙特卡洛穷举整个序列(成本高、方差大),而是只采样走一两步(TD-1),利用状态的“时齐性”局部更新。
  • 问题 2:状态 $S$ 处于无限高维空间,列不出表格怎么办?
    • 解法Deep RL(深度强化学习)。用神经网络(参数模型)来近似拟合 Value Function 或 Policy Function。

第三部分:大模型的 RLHF 技术拆解

RLHF(Reinforcement Learning from Human Feedback)是将不可言说的“人类偏好”转化为机器可学习的强化学习过程。

1. 大模型与 RL 的映射对照

  • Action (行动):大模型每次生成(预测)的下一个 Token
  • State (状态):用户输入的 Prompt + 模型已经生成的上文。
  • Reward (奖励):这段对话是否符合人类的语法、逻辑与偏好。

2. RLHF 操作流水线(四大模型架构)

标准的 RLHF 并非只训一个模型,而是四个模型联动作业。

模型名称来源与作用状态与更新说明
1. Actor Model (演员模型)即最终交付给用户的那个大模型基座。必须用经过 SFT(有监督微调)后的模型进行初始化。核心被训对象。根据 Critic 给的奖励不断更新权重。
2. Reference Model (参考模型)Actor 模型的“镜像备份”。同样用 SFT 模型初始化。为防止强化学习把模型“训崩/训得满嘴胡话”,训练时计算 Actor 与 Reference 之间的 KL 散度惩罚完全冻结(不更新)。始终作为“不要偏离人类正常语言太远”的基准锚点。
3. Reward Model (奖励模型)额外训练的打分器。利用海量人类标注的偏序数据(即“句子 A 比句子 B 更好”)训练出来的小型神经网络(几千万~几亿参数)。提前单独训好,在 RLHF 过程中完全冻结。代表人类给每个回答打出“即刻评分”。
4. Critic Model (评论家模型)一般由 Reward Model 初始化而来。Reward 只能给当前的 Token/句子打“即刻奖励”,而 Critic 负责预估生成完整段落的“总收益 (Value)”。在 RLHF 过程中随 Actor 同步更新参数

  • Actor Model:训练方式:每次给一个prompt,用Actor生成对应的response,而后送入奖励模型计算loss,并用于更新actor
  • Reference Model:在训练过程中,reference需要冻结,防止RLHF将Actor Model“训坏了”
    • 具体操作:惩罚actor model (可变) 与 Reference model (不可变) 之间的KL
  • Reward Model:可以由人类数据提前训练,一般是一个比较小的神经网络。
  • Critic Model:虽然我们有一个reward model,但其为即时收益,并非是全部的总收益。因此我们需要训练一个模型去预测它。
  • 核心认知:在业界实践中,Reward Model 的好坏起着决定性作用。如果在竞赛/前沿模型(如 GPT-5, 数学竞赛大模型)中要拉开差距,大多是在 Reward Model 的标注质量与损失函数设计上发力。

AI工具与核心概念梳理

工具分类工具名称核心功能与应用领域亮点/启发
算法经典DQN (Deep Q-Network)将深度学习引入强化学习的里程碑算法,通过神经网络近似 Q 函数。引入了“经验回放 (Experience Replay)”(打乱时序数据变为独立同分布)和“目标网络 (Target Network)”**,极大稳定了极易崩溃的 RL 训练。
系统应用AlphaGo强化学习最著名的成功案例之一。结合 RL 与蒙特卡洛树搜索下围棋。围棋的 Reward 极其清晰(输/赢),相比之下,大模型的语言输出好坏(偏好)极其模糊,引出了后续的 Reward Model。
架构工具RLHF (四模型基本框架)大模型对齐(Alignment)的标准工业流水线架构。用于让 LLM 听懂人话、符合人类价值观。需要协同运作 4 个模型(Actor, Reference, Reward, Critic),训练极其脆弱敏感,依赖精巧的初始化与 KL 散度惩罚。

更多推荐