想象一下,你刚买了一只聪明但未经训练的边牧犬。它天生聪明,能听懂很多指令,但就是不知道什么时候该做什么,甚至可能在你想要安静时狂吠不止。大语言模型在预训练后,就像这只聪明的边牧犬——知识渊博却不懂规矩。后训练技术,就是训练这只“AI边牧”的关键方法。

为何需要后训练?从“知识库”到“好帮手”的蜕变

大语言模型通过预训练学习了海量知识,但它们往往不知道如何“得体地”使用这些知识。你可能遇到过这样的尴尬:向模型询问敏感话题时,它可能给出不恰当的回答;或者让它写一首诗,它却开始长篇大论讲诗歌理论。

后训练解决了这个核心问题:对齐(Alignment)——让模型的输出与人类的价值观、意图和偏好保持一致。

主要有三类后训练技术:

  • 监督微调(SFT):使用高质量对话数据直接微调

  • 基于人类反馈的强化学习(RLHF):包括PPO及其变体

  • 偏好对齐方法:包括DPO、KTO等更高效的新方法

在正式展开介绍前,我们先来梳理后训练中的几个核心关键名词,并结合大语言模型(LLM)的应用场景做对应解析,同时明确各概念的核心定义与数据流转逻辑:

在大语言模型(LLM)的落地场景中,强化学习的核心概念可完成如下精准映射:

  • 状态(State):一般为完整的对话历史,或是用户当前的提问内容(Prompt)。它代表着模型需要做出生成决策的核心环境与上下文依据,是模型所有决策的出发点。

  • 动作(Action):指模型在生成过程中,每一步选取的单个词元(Token),也可指代最终生成的完整回答序列。在文本生成的每一个步骤中,模型都会通过选择对应的动作,逐步完成回应内容的拓展与补全。

  • 奖励(Reward):当模型生成完整的回答文本后,由奖励模型(RM)输出的一个标量评分。该分数是对回答整体质量的综合评判,核心衡量维度包括回答是否具备实用性、是否合规无害、是否贴合人类偏好等。

  • 优势(Advantage):这是 PPO 训练中至关重要的核心计算值。其核心内涵是:在既定的状态下,模型选择某一个特定动作的收益,相较于该状态下采取所有动作的平均收益,究竟好出多少。公式可简化理解为:优势 ≈ 实际获得的奖励 - 该状态下的平均预期奖励。PPO 正是依靠这一数值,更稳定、高效地判断哪些生成行为值得强化与鼓励,哪些行为需要抑制。

完整文章链接:https://mp.weixin.qq.com/s/hpiVJv-Zqzl27hQSUNBYgQ

更多推荐