不学新本领,只做对选择:ReasonMaxxer 揭示大模型推理的“无强化学习”新范式
·
不学新本领,只做对选择:ReasonMaxxer 揭示大模型推理的“无强化学习”新范式
南加州大学(University of Southern California, USC)和美国陆军研究实验室(DEVCOM Army Research Laboratory, DEVCOM ARL)联合研究指出,强化学习(RL)提升大语言模型推理能力的本质并非让模型习得新技能,而是在关键决策点对已有策略进行稀疏选择。通过对不同模型及其RL算法的令牌级分析,研究发现RL仅修改了约 1%至3% 的令牌位置,且这些修改精准集中在高熵(即模型不确定)的决策点上。通过仅针对这些特定位置进行微调,模型能够以极低维度的参数调整找回RL带来的大部分性能增益。基于此发现,作者提出了 REASONMAXXER 方法,这是一种无需RL流程的轻量化方案。该方法仅需极少量的基础模型采样和分钟级的单显卡训练,即可在多项数学基准测试中达到甚至超越完整RL的效果。最终,这项工作证明了通过熵门控决策点进行针对性优化,可以将训练成本降低约三个数量级。
论文("ReasonMaxxer: Sparse Policy Selection as an RL-Free Reasoning Paradigm")挑战了当前大语言模型(LLM)后训练中对强化学习(RL)的重度依赖,提出了一套全新的、极低成本的无强化学习(RL-Free)推理能力提升范式。
一、 核心观点
- 强化学习本质是“稀疏策略选择”,而非“能力习得”
传统的观点认为,RL(如 GRPO 或 PPO)能通过大规模探索让模型学到全新的推理路径。但论文指出,RL 并没有赋予模型新的推理能力,而只是对基座模型本就拥有的解空间进行概率质量的重新分配,即召回并提升基座模型原本就具备的正确解。RL 的本质实际上是极少数关键分叉点上的精准纠偏。 - 修正极度稀疏、保守且集中在“高熵决策点”
RL 对基座模型的改变极为微小,仅影响了 1% ~ 3% 的 Token 位置。而且,RL 几乎从不凭空创造新词,它推荐的 Token 几乎全部属于基座模型原本预测概率的前 5 名(Top-5)。这些被修正的位置正是基座模型在多个推理分支间犹豫不决的 高熵决策点(Forking Tokens)。 - 纠偏具有因果决定性,且能通过基座模型自身的熵直接定位
干预实验表明,仅在这些极少数的分歧 Token 上强行替换为 RL 模型的选择,就能100% 恢复强化学习带来的全部准确率提升。更重要的是,这些关键决策点不需要 RL 教师模型来寻找,仅凭基座模型自身的 token 生成熵就能完美定位。 - 纠偏信号在参数空间具有“极低维性”
RL 对模型的分布修正可以用极小的参数量进行表征。通过在仅仅 100 个问题上进行 KL 散度蒸馏,一个仅占模型参数总量约 0.3%~0.5% 的 rank-32 LoRA 适配器,就能完整复刻 RL 教师模型的推理准确率。 - 无 RL 替代方案:REASONMAXXER 算法
基于上述发现,作者推出了 REASONMAXXER 算法。其工作流非常简单:- 挑选“边缘能力”问题:筛选出基座模型采样生成的解答中,既有正确也有错误(混合成功率)的问题。
- 通过基座熵定位决策点:当 Token 的生成熵 HtHt 超过设定阈值 ττ 时判定为决策点。
- 优势加权对比损失(Advantage-Weighted Contrastive Loss):在决策点上,对引导向正确答案的 Token 予以奖励,对引导向错误答案的 Token 进行惩罚;而在非决策点位置,则通过 KL 散度将输出锚定(Anchor)到基座分布上,防止模型过拟合。
二、 关键数据
1. Token 级别的微观数据特征
- 修改占比极低:在不同的模型家族(Qwen2.5, Qwen3 等)中,RL 带来的 Token 重新排序(Reranked)仅发生在 1.0% ~ 4.1% 的位置。
- 保守性极强:将 Top-5 之外的 Token 提升到第一名的概率(Shifted 概率)几乎为零(仅为 0.01% ~ 0.12%),RL 推荐的 Token 在基座中的平均概率排名为 2.14 ~ 2.39。
- 熵值差异巨大:这些发生修改的决策点,其基座模型熵值比未修改的位置高出 5 ~ 12 倍(具体为 7.58x ~ 12.63x)。
2. 极低维适配器与超轻量训练集
- 微型适配器复刻 RL:仅用 0.27% ~ 0.49% 的参数量(LoRA 秩为 32),并在 100 个随机问题上蒸馏,即可复刻 RL 模型的全部精度。
- REASONMAXXER 极小训练集:仅需 50 个具有混合成功率的数学问题(每个问题采样 20 个 rollout,总共 1000 个训练序列),即可完成训练。相比之下,传统的 GRPO 训练(如 SimpleRL-Zoo)需要使用 8,000 个甚至多达 57,000 个问题。
3. 性能表现与惊人的成本缩减 (MATH-500 评测)
在数学推理基准测试(MATH-500)中,REASONMAXXER 以极低的计算成本匹配甚至超越了全量强化学习的基线:
| 模型与配置 | MATH-500 准确率 | 估计训练成本 (USD) | 相比完整 RL 成本缩减 |
|---|---|---|---|
| Qwen2.5-1.5B (基座) | 29.8% | - | - |
| ↪ + SimpleRL-Zoo (GRPO) | 49.6% | \$200 | 基准线 |
| ↪ + Open-Reasoner-Zero (PPO) | 43.6% | \$1,200 | 基准线 |
| ↪ + REASONMAXXER | 50.2% | \$4 | 降低约 50x ~ 300x |
| Qwen2.5-7B (基座) | 58.6% | - | - |
| ↪ + SimpleRL-Zoo (GRPO) | 65.6% | \$600 | 基准线 |
| ↪ + Open-Reasoner-Zero (PPO) | 73.2% | \$6,300 | 基准线 |
| ↪ + REASONMAXXER | 70.6% | \$5 | 降低约 120x ~ 1260x |
| DeepSeek-R1-Distill-1.5B (基座) | 43.6% | - | - |
| ↪ + DeepScaleR (GRPO) | 50.2% | \$4,500 | 基准线 |
| ↪ + REASONMAXXER | 66.2% | \$4 | 降低超 1000x |
4. 算法消融与鲁棒性数据
- 熵阈值 ττ 的鲁棒性:当 ττ 在 1.0 至 2.2 之间变化时,算法性能表现非常稳定。在 τ=1.4τ=1.4(筛选出 5.2% 的决策 Token)或 τ=1.8τ=1.8(筛选出 2.6% 的决策 Token)时,模型性能达到巅峰。
- 对比惩罚(Contrastive Loss)的必要性:如果仅对正确路径进行正向强化(即类似于 SFT,而不惩罚错误路径),Qwen2.5-1.5B 在 MATH-500 上的得分仅能从 29.8% 提升到 39.8%,而加上惩罚错误分支的对比损失后,能飙升至 50.2%,这证明了“惩罚错误”贡献了大约一半的性能增益。
https://arxiv.org/pdf/2605.06241
更多推荐


所有评论(0)