论文链接: https://arxiv.org/pdf/2508.00222
代码链接: https://github.com/YihongDong/RL-PLUS

点击阅读原文,获取论文更多相关信息

引言:当强化学习遭遇“能力边界塌缩”

近年来,基于可验证奖励的强化学习(RLVR)范式在提升大型语言模型(LLM)的复杂推理能力方面取得了显著成功。然而,研究人员发现了一个棘手的问题:无论如何优化,模型似乎都难以突破其基础模型(Base Model)固有的能力上限,这种现象被称为“能力边界塌缩”(Capability Boundary Collapse)。

该问题的核心在于,RLVR本质上是一种在线策略(on-policy)学习,在面对LLM巨大的解空间和稀疏的奖励信号时,模型倾向于利用(Exploitation)和优化已知的推理路径,而难以进行有效的向外探索(Exploration)以发现新知识。这导致模型解决问题的范围逐渐收缩,而非扩展。

本文介绍的 RL-PLUS 框架,旨在解决这一根本性挑战。它通过一种创新的混合策略优化方法,将外部知识的“学”(SFT阶段)与内部推理优化的“思”(RL阶段)深度融合,从而帮助大模型突破能力边界,实现持续的自我进化。

图1 : (a) 传统RLVR方法(如GRPO)训练后,模型推理范围可能收缩,即能力边界塌缩。(b) RL-PLUS旨在克服此问题,在pass@k指标上持续超越基础模型

核心洞察:“学”与“思”的融合之道

论文作者的洞察力源于古老的教育理念:“学而不思则罔,思而不学则殆”。

  • 思而不学则殆:当前的RLVR方法重“思”,擅长在已有知识上进行优化。但其固有的在线策略使其难以从外部高效学习新知识,导致进步停滞。
  • 学而不思则罔:传统的监督微调(SFT)方法重“学”,通过模仿外部数据进行学习,但缺乏内在的推理和泛化能力,面对新问题时表现脆弱。

RL-PLUS 的目标是融合二者之长,让模型既能吸收外部高质量数据,又能在强化学习中进行有效的内部优化。为此,必须解决两大技术难题:

  1. 分布不匹配问题:如何将在外部数据(off-policy)上学习的信号,稳定地融入到当前模型的在线策略(on-policy)优化中。
  2. 新知识的高效提取:如何引导模型关注并学习外部数据中那些正确但自身难以发现(即低概率)的推理路径。

RL-PLUS 方法详解

RL-PLUS通过两大核心技术创新来应对上述挑战。

1. 多重重要性采样

为了稳定地整合来自外部数据集 De 的知识,一个关键挑战是处理目标策略 π_θ 与外部数据生成策略 π_ω 之间的分布差异。标准的做法存在两难:

  • 在线策略代理估计:使用 π_θ_old 作为分母进行重要性采样,在处理外部数据时会引入系统性偏差。
  • 离线策略直接估计:理论上正确,但 π_θπ_ω 的巨大差异会导致极高的方差,使训练不稳定。

RL-PLUS 引入 多重重要性采样 (MIS) 来解决此问题。它将外部样本视为由旧策略 π_θ_old 和外部策略 π_ω 构成的混合策略所生成,其重要性采样权重定义如下:

r i , t m ( θ ) = 2 π θ ( e i , t ∣ q , e i , < t ) π ω ( e i , t ∣ q , e i , < t ) + π θ old ( e i , t ∣ q , e i , < t ) r_{i,t}^m(\theta) = \frac{2\pi_\theta(e_{i,t}|q, e_{i,<t})}{\pi_\omega(e_{i,t}|q, e_{i,<t}) + \pi_{\theta_{\text{old}}}(e_{i,t}|q, e_{i,<t})} ri,tm(θ)=πω(ei,tq,ei,<t)+πθold(ei,tq,ei,<t)2πθ(ei,tq,ei,<t)
公式 (4) : 多重重要性采样权重。

这种方法巧妙地通过在分母中引入 π_θ_old,即使在 π_ω 未知或差异巨大时,也能有效控制方差,将潜在的爆炸性偏差转化为一个有界的、可控的失真误差,从而保证了外部数据整合的稳定性。

2. 基于探索的优势函数

稳定引入数据只是第一步,更重要的是引导模型学习其中的“新知识”。这些新知识通常对应模型当前认为概率很低的推理路径。为此,RL-PLUS 设计了 基于探索的优势函数,以放大对这类路径的学习信号。其定义为:

A i , t c = R i − mean ( { R 1 , . . . , R G } ) std ( { R 1 , . . . , R G } ) ⋅ C i , t A_{i,t}^c = \frac{R_i - \text{mean}(\{R_1, ..., R_G\})}{\text{std}(\{R_1, ..., R_G\})} \cdot C_{i,t} Ai,tc=std({R1,...,RG})Rimean({R1,...,RG})Ci,t
公式 (5) : 优势函数的第一部分是标准化的奖励。

其中,关键在于探索权重 C_i,t,其设计受 Focal Loss 启发:

C i , t = ( 1 − detach ( π θ ( e i , t ∣ q , e i , < t ) ) ) γ C_{i,t} = (1 - \text{detach}(\pi_\theta(e_{i,t}|q, e_{i,<t})))^\gamma Ci,t=(1detach(πθ(ei,tq,ei,<t)))γ
公式 (6) : 探索权重 C_i,t

当模型探索某个正确 token e_i,t 的概率 π_θ 很低时(即“难以探索”),C_i,t 的值会变大,从而放大其优势信号 A_i,t^c,反之亦然。这使得模型被激励去关注那些高质量但自身难以发现的推理步骤。

3. RL-PLUS 最终目标函数

RL-PLUS 将内部利用(Do)和外部探索(De)协同起来,最终的训练目标定义为:

J RL-PLUS ( θ ) = E ( o i , A i ) ∼ D o [ r i , t ( θ ) A i ] + E ( e i , A i , t c ) ∼ D e [ r i , t m ( θ ) A i , t c ] J_{\text{RL-PLUS}}(\theta) = \mathbb{E}_{(o_i, A_i) \sim D_o}[r_{i,t}(\theta)A_i] + \mathbb{E}_{(e_i, A_{i,t}^c) \sim D_e}[r_{i,t}^m(\theta)A_{i,t}^c] JRL-PLUS(θ)=E(oi,Ai)Do[ri,t(θ)Ai]+E(ei,Ai,tc)De[ri,tm(θ)Ai,tc]
公式 (7) : RL-PLUS 的复合目标函数。

  • 第一项(内部利用): 标准的策略梯度目标,负责优化模型已有的推理能力。
  • 第二项(外部探索): RL-PLUS 的核心创新,利用多重重要性采样(r_m)和基于探索的优势函数(A_c),驱动模型从外部数据中高效学习新知识。

点击阅读原文,获取论文更多相关信息

实验结果:全面超越与能力突破

论文通过广泛的实验验证了RL-PLUS的有效性。

1. 域内与域外任务性能

在6个复杂的数学推理基准测试(如AIME、AMC等)上,RL-PLUS 取得了全面的 SOTA 性能,相较于主流的 SFT+GRPO 范式,平均得分高出 5.2 个点。

表格1 : RL-PLUS在多个数学推理基准上与基线方法的性能对比

在6个域外(Out-of-Distribution)任务上,包括代码生成和科学问答,RL-PLUS 表现出更强的泛化能力。实验表明,传统SFT方法会损害模型的域外泛化性,而RL-PLUS成功解决了“知识-泛化”的权衡问题,在域内和域外任务上均取得领先。

2. 训练动态:实现探索与利用的平衡

训练过程中的动态曲线显示,RL-PLUS在测试准确率和奖励方面持续优于基线方法。尤其值得注意的是策略熵的变化:

  • 基线方法GRPO的熵在训练中会坍塌至接近零,意味着模型丧失了探索能力。
  • RL-PLUS的熵则稳定在一个健康的非零范围,表明模型在提升能力的同时,保留了进一步探索的潜力。

图2 : 训练动态对比。RL-PLUS(蓝线)在测试得分、奖励和策略熵方面均表现出优越的稳定性和潜力

3. Pass@k分析:真正突破能力边界

Pass@k 曲线分析是衡量模型能力边界的关键。

  • GRPO的性能曲线随着k值增大,逐渐与基础模型重合,甚至低于基础模型,证实了“能力边界塌缩”的存在。
  • RL-PLUS 的性能曲线在所有k值下都持续显著优于基础模型和GRPO,这有力地证明了RL-PLUS能够有效突破基础模型的能力上限。

图3 : Pass@k曲线对比。RL-PLUS(蓝线)在k值增大时,依然保持对基础模型和GRPO的性能优势

结论

RL-PLUS 框架通过创新的混合策略优化方法,将外部数据的“学习”与内部策略的“思考”无缝集成。它利用 多重重要性采样 解决了分布不匹配问题,并借助 基于探索的优势函数 激励模型发现新知识。实验证明,该方法不仅在多项推理任务上取得了SOTA性能,更重要的是,它有效解决了“能力边界塌缩”问题,为大型语言模型实现持续的自我进化和能力突破,开辟了一条极具前景的路径。

点击阅读原文,获取论文更多相关信息

更多推荐