摘要:为了进一步增强大语言模型(LLM)解决复杂、多步推理问题的能力,测试时缩放(TTS)方法已受到广泛关注。现有方法(如 Best-of-N 和多数投票)受限于候选回答的质量——当所有候选都错误时,它们也无法给出正确解;而引入额外模型来挑选最佳回答则会显著增加部署成本。为此,我们提出生成式自精炼(GSR),一种新颖的并行测试时缩放框架:统一模型首先并行生成一组候选回答,随后以自我精炼的方式,基于由问题和这些候选构成的提示,合成一条新的更优解答。然而,直接提示 LLM 进行精炼效果不佳。因此,我们设计了一条混合训练流程,联合优化两个互补目标:直接解决问题与精炼候选回答。实验结果表明,我们的方法在五大数学基准上达到 SOTA 性能;进一步显示,这种习得的自精炼技能与模型无关,可跨不同规模稳健迁移,并泛化到分布外推理任务。

论文标题: "Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs"
作者: "Qibin Wang, Pu Zhao, Shaohan Huang,"
发表年份: 2025
原文链接: "https://arxiv.org/pdf/2509.00084"
代码链接: "https://github.com/microsoft/gsr-framework"
关键词: ["生成式自我优化", "测试时缩放", "数学推理", "大语言模型", "自我反思"]
}"

核心要点:GSR(Generative Self-Refinement)框架通过"生成候选解→自我优化"两阶段推理,在AIME24数学竞赛基准上实现66.0%准确率,超越OpenAI o1-mini(56.7%),即使所有候选解错误仍能构造正确答案,彻底突破传统集成方法性能上限。

欢迎大家关注我的公众号:大模型论文研习社
往期回顾:大模型也会 “脑补” 了!Mirage 框架解锁多模态推理新范式,无需生成像素图性能还暴涨

研究背景:大模型的"集体智慧"困境

当你让AI解决复杂问题时,通常会生成多个答案然后选择最好的那个。但如果所有答案都错了怎么办?这正是当前大语言模型集成方法的致命弱点——它们就像一群迷路的登山者,即使所有人都走错路,也只会跟着大多数人的方向继续前进。

这种困境源于三大核心局限:

  • 质量天花板:多数投票和Best-of-N方法性能受限于候选解质量,无法创造超越个体的集体智慧
  • 信息浪费:非最优候选解中的合理片段被完全丢弃,错失潜在正确思路
  • 部署成本:融合方法需训练专用合成器模型,增加系统复杂度和计算开销

以数学推理为例,当面对"AIME24"这类高难度问题时:

  • 基础模型pass@1准确率仅13.2%
  • 多数投票(maj@4)提升至16.7%
  • 最佳Reward Model(RM-R1-7B)也只能达到62.1%

GSR框架创新性地让单个模型同时扮演"解题者"和"审阅者"双重角色,通过自我反思机制从错误中学习,就像学生在考试中检查错题并修正答案的过程。

方法总览:两阶段自我进化引擎

GSR框架的核心在于将人类"多方案比较择优"的决策过程系统化,构建了从候选生成到自我优化的完整闭环:

GSR方法总览

1. 并行候选生成阶段

  • 输入:原始问题(如数学竞赛题)
  • 输出:4个并行候选解(包含推理过程)
  • 特点:通过温度采样控制多样性,确保候选解覆盖不同思路

2. 自我优化阶段

  • 输入:原始问题 + 4个候选解
  • 输出:优化后的最终答案
  • 关键能力
    • 错误诊断:识别候选解中的推理缺陷
    • 知识整合:选择性吸收候选解中的有效思路
    • 独立推理:即使所有候选解错误也能生成正确答案

GSR推理流程

关键结论:三大突破性贡献

首创自我优化推理范式:提出"生成-优化"两阶段框架,在所有候选解错误时仍能构造正确答案,突破传统集成方法性能天花板

混合训练双能力协同:通过联合优化直接解题和自我优化目标,使模型同时具备高质量候选生成和错误修正能力,解决生成与优化脱节问题

跨尺度跨领域泛化:在14B/32B模型上保持性能优势,从数学推理迁移至逻辑 puzzles 领域准确率提升24.4%,验证方法普适性

深度拆解:从错误中学习的艺术

候选生成机制

GSR首先让模型生成4个多样化候选解,关键在于控制推理路径多样性

  • 使用温度=0.7的采样策略
  • 限制单候选解推理长度≤1024token
  • 对数学问题强制要求分步计算格式

以"AIME24"问题为例,模型会生成包含不同错误的候选解:

  • 候选1:因数分解错误(196=2²×7²误写为2×7⁴)
  • 候选2:商数计算错误(5694÷1000得商5余694误写为商5余624)
  • 候选3:边界条件遗漏(未考虑四位数上限)
  • 候选4:计算符号错误(将"+“误写为”-")

自我优化核心技术

GSR的真正创新在于优化阶段的提示工程,其模板设计包含三大关键要素:

GSR提示模板

  1. 错误诊断引导
"分析每个候选解的推理步骤,指出具体错误位置和原因"
  1. 选择性整合策略
"不要直接复制候选解,仅吸收有效思路,独立构建推理链"
  1. 独立验证机制
"即使所有候选解错误,也要基于自身知识生成正确答案"

混合训练 pipeline

为使模型同时掌握生成和优化能力,GSR设计了独特的混合训练流程:

GSR训练流程

数据生成阶段:
  1. 学生模型生成候选解(Qwen2.5-7B)
  2. 教师模型提供优化答案(QwQ-32B)
  3. 构建两类训练数据:
    • 直接解题数据(问题→正确答案)
    • 优化数据(问题+候选解→优化答案)
联合优化阶段:

损失函数组合直接解题损失和优化损失

  • 直接解题损失:最大化正确答案概率
  • 优化损失:最大化基于候选解的优化答案概率

实验结果:数学推理性能突破

跨基准综合性能

GSR-7B在五大数学基准上实现全面领先:
GSR综合性能对比

关键指标对比:

  • AIME24:66.0%(selfRef@4) vs 62.1%(RM-R1-7B)
  • AIME25:51.7%(selfRef@4) vs 50.8%(OpenAI o1-mini)
  • 平均准确率:73.6%(selfRef@4) vs 70.9%(RM-R1-7B)

特别值得注意的是,GSR在MATH500数据集上达到93.4%准确率,仅略低于最佳Reward Model的93.5%,但无需额外模型部署成本。

错误容忍能力分析

当候选解质量下降时,GSR优势更加明显:

候选解质量敏感性分析

在不同正确候选数条件下的准确率:

  • 4个正确:100%(与其他方法持平)
  • 1个正确:60.2%(远超多数投票的18.8%)
  • 0个正确:5.9%(唯一能从全错候选中生成正确答案的方法)

这种"化腐朽为神奇"的能力在AMC22-23数据集上达到9.0%,相当于每11个全错候选集中能修正1个正确答案。

模型尺度扩展性

GSR性能随模型规模增长而提升,32B模型在AIME25达到67.3%准确率:

模型尺度性能对比

  • 14B模型:AIME24准确率68.1%(相对maj@4提升20.1%)
  • 32B模型:AIME25准确率67.3%(相对maj@4提升13.7%)
  • 性能增益:规模每增加约2倍,准确率提升8-10%

未来工作:突破与挑战

技术局限性

当前GSR框架存在三个主要瓶颈:

  1. 计算成本:生成4个候选解使推理时间增加3倍
  2. 优化上限:当候选解缺乏关键思路时优化效果下降
  3. 领域依赖:在符号推理任务上性能提升幅度小于数学领域

潜在改进方向

  1. 动态候选生成:根据问题难度自适应调整候选解数量(2-8个)
  2. 多轮优化机制:迭代优化答案,每轮生成新候选解
  3. 跨模态优化:结合图表和公式解析增强数学推理能力

个人见解

GSR框架揭示了一个重要趋势:大模型正在从"单一解题者"向"协作系统"进化。未来可能出现的发展包括:

  • 专业化分工:不同模型专注于生成、优化、验证等不同环节
  • 集体智慧涌现:通过模型间辩论进一步提升推理质量
  • 错误驱动学习:从错误案例中提取通用修正策略

更多推荐