告别“思而不学”!通义×北大破局之作RL-PLUS,让大模型真正学会思考,突破推理边界!

论文链接: https://arxiv.org/pdf/2508.00222
代码链接: https://github.com/YihongDong/RL-PLUS
引言:当强化学习遭遇“能力边界塌缩”
近年来,基于可验证奖励的强化学习(RLVR)范式在提升大型语言模型(LLM)的复杂推理能力方面取得了显著成功。然而,研究人员发现了一个棘手的问题:无论如何优化,模型似乎都难以突破其基础模型(Base Model)固有的能力上限,这种现象被称为“能力边界塌缩”(Capability Boundary Collapse)。
该问题的核心在于,RLVR本质上是一种在线策略(on-policy)学习,在面对LLM巨大的解空间和稀疏的奖励信号时,模型倾向于利用(Exploitation)和优化已知的推理路径,而难以进行有效的向外探索(Exploration)以发现新知识。这导致模型解决问题的范围逐渐收缩,而非扩展。
本文介绍的 RL-PLUS 框架,旨在解决这一根本性挑战。它通过一种创新的混合策略优化方法,将外部知识的“学”(SFT阶段)与内部推理优化的“思”(RL阶段)深度融合,从而帮助大模型突破能力边界,实现持续的自我进化。

核心洞察:“学”与“思”的融合之道
论文作者的洞察力源于古老的教育理念:“学而不思则罔,思而不学则殆”。
- 思而不学则殆:当前的RLVR方法重“思”,擅长在已有知识上进行优化。但其固有的在线策略使其难以从外部高效学习新知识,导致进步停滞。
- 学而不思则罔:传统的监督微调(SFT)方法重“学”,通过模仿外部数据进行学习,但缺乏内在的推理和泛化能力,面对新问题时表现脆弱。
RL-PLUS 的目标是融合二者之长,让模型既能吸收外部高质量数据,又能在强化学习中进行有效的内部优化。为此,必须解决两大技术难题:
- 分布不匹配问题:如何将在外部数据(off-policy)上学习的信号,稳定地融入到当前模型的在线策略(on-policy)优化中。
- 新知识的高效提取:如何引导模型关注并学习外部数据中那些正确但自身难以发现(即低概率)的推理路径。
RL-PLUS 方法详解
RL-PLUS通过两大核心技术创新来应对上述挑战。
1. 多重重要性采样
为了稳定地整合来自外部数据集 De 的知识,一个关键挑战是处理目标策略 π_θ 与外部数据生成策略 π_ω 之间的分布差异。标准的做法存在两难:
- 在线策略代理估计:使用
π_θ_old作为分母进行重要性采样,在处理外部数据时会引入系统性偏差。 - 离线策略直接估计:理论上正确,但
π_θ和π_ω的巨大差异会导致极高的方差,使训练不稳定。
RL-PLUS 引入 多重重要性采样 (MIS) 来解决此问题。它将外部样本视为由旧策略 π_θ_old 和外部策略 π_ω 构成的混合策略所生成,其重要性采样权重定义如下:
r
i
,
t
m
(
θ
)
=
2
π
θ
(
e
i
,
t
∣
q
,
e
i
,
<
t
)
π
ω
(
e
i
,
t
∣
q
,
e
i
,
<
t
)
+
π
θ
old
(
e
i
,
t
∣
q
,
e
i
,
<
t
)
r_{i,t}^m(\theta) = \frac{2\pi_\theta(e_{i,t}|q, e_{i,<t})}{\pi_\omega(e_{i,t}|q, e_{i,<t}) + \pi_{\theta_{\text{old}}}(e_{i,t}|q, e_{i,<t})}
ri,tm(θ)=πω(ei,t∣q,ei,<t)+πθold(ei,t∣q,ei,<t)2πθ(ei,t∣q,ei,<t)
公式 (4) : 多重重要性采样权重。
这种方法巧妙地通过在分母中引入 π_θ_old,即使在 π_ω 未知或差异巨大时,也能有效控制方差,将潜在的爆炸性偏差转化为一个有界的、可控的失真误差,从而保证了外部数据整合的稳定性。
2. 基于探索的优势函数
稳定引入数据只是第一步,更重要的是引导模型学习其中的“新知识”。这些新知识通常对应模型当前认为概率很低的推理路径。为此,RL-PLUS 设计了 基于探索的优势函数,以放大对这类路径的学习信号。其定义为:
A
i
,
t
c
=
R
i
−
mean
(
{
R
1
,
.
.
.
,
R
G
}
)
std
(
{
R
1
,
.
.
.
,
R
G
}
)
⋅
C
i
,
t
A_{i,t}^c = \frac{R_i - \text{mean}(\{R_1, ..., R_G\})}{\text{std}(\{R_1, ..., R_G\})} \cdot C_{i,t}
Ai,tc=std({R1,...,RG})Ri−mean({R1,...,RG})⋅Ci,t
公式 (5) : 优势函数的第一部分是标准化的奖励。
其中,关键在于探索权重 C_i,t,其设计受 Focal Loss 启发:
C
i
,
t
=
(
1
−
detach
(
π
θ
(
e
i
,
t
∣
q
,
e
i
,
<
t
)
)
)
γ
C_{i,t} = (1 - \text{detach}(\pi_\theta(e_{i,t}|q, e_{i,<t})))^\gamma
Ci,t=(1−detach(πθ(ei,t∣q,ei,<t)))γ
公式 (6) : 探索权重 C_i,t。
当模型探索某个正确 token e_i,t 的概率 π_θ 很低时(即“难以探索”),C_i,t 的值会变大,从而放大其优势信号 A_i,t^c,反之亦然。这使得模型被激励去关注那些高质量但自身难以发现的推理步骤。
3. RL-PLUS 最终目标函数
RL-PLUS 将内部利用(Do)和外部探索(De)协同起来,最终的训练目标定义为:
J
RL-PLUS
(
θ
)
=
E
(
o
i
,
A
i
)
∼
D
o
[
r
i
,
t
(
θ
)
A
i
]
+
E
(
e
i
,
A
i
,
t
c
)
∼
D
e
[
r
i
,
t
m
(
θ
)
A
i
,
t
c
]
J_{\text{RL-PLUS}}(\theta) = \mathbb{E}_{(o_i, A_i) \sim D_o}[r_{i,t}(\theta)A_i] + \mathbb{E}_{(e_i, A_{i,t}^c) \sim D_e}[r_{i,t}^m(\theta)A_{i,t}^c]
JRL-PLUS(θ)=E(oi,Ai)∼Do[ri,t(θ)Ai]+E(ei,Ai,tc)∼De[ri,tm(θ)Ai,tc]
公式 (7) : RL-PLUS 的复合目标函数。
- 第一项(内部利用): 标准的策略梯度目标,负责优化模型已有的推理能力。
- 第二项(外部探索): RL-PLUS 的核心创新,利用多重重要性采样(
r_m)和基于探索的优势函数(A_c),驱动模型从外部数据中高效学习新知识。
实验结果:全面超越与能力突破
论文通过广泛的实验验证了RL-PLUS的有效性。
1. 域内与域外任务性能
在6个复杂的数学推理基准测试(如AIME、AMC等)上,RL-PLUS 取得了全面的 SOTA 性能,相较于主流的 SFT+GRPO 范式,平均得分高出 5.2 个点。

在6个域外(Out-of-Distribution)任务上,包括代码生成和科学问答,RL-PLUS 表现出更强的泛化能力。实验表明,传统SFT方法会损害模型的域外泛化性,而RL-PLUS成功解决了“知识-泛化”的权衡问题,在域内和域外任务上均取得领先。
2. 训练动态:实现探索与利用的平衡
训练过程中的动态曲线显示,RL-PLUS在测试准确率和奖励方面持续优于基线方法。尤其值得注意的是策略熵的变化:
- 基线方法GRPO的熵在训练中会坍塌至接近零,意味着模型丧失了探索能力。
- RL-PLUS的熵则稳定在一个健康的非零范围,表明模型在提升能力的同时,保留了进一步探索的潜力。

3. Pass@k分析:真正突破能力边界
Pass@k 曲线分析是衡量模型能力边界的关键。
- GRPO的性能曲线随着k值增大,逐渐与基础模型重合,甚至低于基础模型,证实了“能力边界塌缩”的存在。
- RL-PLUS 的性能曲线在所有k值下都持续显著优于基础模型和GRPO,这有力地证明了RL-PLUS能够有效突破基础模型的能力上限。

结论
RL-PLUS 框架通过创新的混合策略优化方法,将外部数据的“学习”与内部策略的“思考”无缝集成。它利用 多重重要性采样 解决了分布不匹配问题,并借助 基于探索的优势函数 激励模型发现新知识。实验证明,该方法不仅在多项推理任务上取得了SOTA性能,更重要的是,它有效解决了“能力边界塌缩”问题,为大型语言模型实现持续的自我进化和能力突破,开辟了一条极具前景的路径。
更多推荐
所有评论(0)