3D测试时缩放框架:突破上下文限制,提升大模型推理与具身学习能力
摘要:3D 测试时缩放框架,整合上下文、批次、轮次三维缩放,突破大模型上下文长度限制,在 IMO、CPHO、IOI 等难题上提升推理精度,还可结合人类反馈拓展至具身学习,实现类人机器人控制行为设计。
一、引言
推理强化学习领域近期发现了一种新的缩放效应:测试时缩放。以 R1、o1 为代表的推理模型在测试阶段,推理准确率会随推理上下文长度的增加而提升。但与训练时缩放相比,测试时缩放本质上受限于基础模型的上下文长度 —— 现有模型支持的上下文长度仅百万级令牌,远低于训练阶段消耗的万亿级令牌规模。
由清华大学和纽约大学团队联合研发的从缩放效应视角重新审视测试时增强技术《Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn》:提出多维度测试时缩放统一框架,拓展测试时推理的能力边界。除传统的上下文长度缩放外,我们还引入另外两个维度:批次缩放(并行采样数量增加可提升准确率)和轮次缩放(迭代式自优化可增强推理质量)。基于这一视角,我们提出整合上下文、批次、轮次缩放的 3D 测试时缩放方法,并验证:
1)每个维度均存在测试时缩放效应,但能力上限有限;
2)整合三维缩放可显著提升 IOI、IMO、CPHO 等复杂测试集的推理性能,且能进一步借助人类偏好反馈提升效果;
3)人类在环框架可自然拓展至更开放的具身学习领域,支持类人机器人控制行为的设计。
现有推理模型的测试时缩放潜力受限于上下文窗口大小,即使最先进的商用推理系统,支持的上下文令牌数也不足百万,与训练阶段消耗的数十万亿令牌相比可忽略不计。这一差距引出核心问题:如何拓展测试时缩放的能力边界?
值得注意的是,已有多种提升推理模型测试性能的常用策略:例如多数投票通过并行生成多个候选输出并选择最频繁结果提升准确率;Reflexion、上下文学习等方法通过迭代式自优化反复修正解决方案,实证表明多轮优化的准确率高于直接输出结果。
本文将这些多样的技术统一至多维度测试时缩放框架中,具体涵盖三个维度:
1)上下文缩放:推理准确率随推理上下文长度增加而提升;
2)批次缩放:多数投票等方法可视为批次维度的缩放,更多并行样本能得到更优的聚合结果;
3)轮次缩放:迭代优化方法对应轮次维度的缩放,更多优化轮次可提升准确率。
每个缩放维度均与大模型的上下文长度限制、能力边界相互作用,形成独特的实证权衡关系。基于此,我们提出 3D 测试时缩放,整合上述三个维度,验证该统一框架可显著拓展测试时缩放的计算上限,并支持人类在环范式,适配更开放的应用领域。
二、相关工作
2.1 缩放效应
大语言模型预训练的性能随模型规模、数据集规模、计算预算等核心训练资源呈可预测的缩放规律。随着 R1、o1 等推理模型的出现,研究开始探索超越训练令牌数量的训练时缩放规律,例如上下文长度相关的缩放行为。测试阶段的缩放规律也被广泛研究,不同推理策略(如多数投票、树搜索)下,性能随推理计算量的缩放规律,以及模型规模与测试时令牌预算的权衡关系均被分析。本文聚焦测试时缩放,提出统一框架刻画上下文、批次、轮次三个维度的缩放效应,而现有研究通常仅关注其中部分维度。
2.2 测试时缩放
测试时缩放指通过增加推理阶段计算量提升模型性能的算法类,主要分为三类:
1)上下文缩放:通过更长的输出序列提升性能,典型如思维链提示,激发大模型分步推理以提升各类基准测试性能,R1、o1 等推理模型的进展进一步验证了上下文缩放对测试性能的提升作用;
2)批次缩放:利用并行计算探索多条推理路径,多数投票是代表性技术,通过生成多条独立推理路径并选择多数结果提升性能,此外测试时搜索、蒙特卡洛树搜索、并行推理等方法也可提升性能;
3)轮次缩放:通过迭代优化提升性能,包括 Self-Refine(模型通过自反馈迭代优化输出,无需额外训练)、Reflexion(通过语言反馈和情景记忆强化语言智能体,提升后续决策能力)。
三、测试时缩放的形式化定义
3.1 大模型推理
本文聚焦大语言模型推理任务:给定问题 x,目标是推导正确的分步解决方案 y。假设存在真值验证器 R (x,y),评估解决方案 y 对问题 x 的正确性,其具体实现随任务变化 —— 例如数学推理任务中验证最终数值答案是否匹配真值,编程任务中验证代码通过的单元测试数量。
大语言模型 π_θ 是由参数 θ 表征的策略,给定输入问题 x,模型自回归逐一生成令牌序列。对于问题分布 D,模型策略 π_θ 的期望得分定义为在分布 D 下,验证器对模型输出解决方案的平均评价。
3.2 测试时缩放的核心目标
测试时缩放的核心目标是通过增加测试阶段计算量提升模型得分,例如上下文缩放允许模型生成更长的响应以实现深度探索。任何测试时缩放方法的效果需从期望得分和计算成本两方面评估,本文以推理过程中生成的理论最大令牌数量化计算成本。
3.3 上下文、批次、轮次三维缩放
3.3.1 上下文缩放
上下文缩放直接控制响应长度,模型在分配的令牌预算 C 下生成响应,推理过程受提示 x 约束,直至生成序列结束令牌或达到最大上下文长度 C。上下文缩放的期望得分定义为上下文长度内生成完整响应的期望奖励。
3.3.2 批次缩放
批次缩放通过生成多个独立候选响应并选择最可能正确的结果,探索多样化的解决方案路径。给定批次大小 B 和单响应上下文预算 C,首先独立生成 B 个响应,再通过聚合函数 A 将 B 个响应映射为最终响应 y_final。
聚合函数的选择至关重要,主要分为两类策略:
1)批次缩放(最优选择):
-
基于评分的最优选择:定义任务专属评分函数 S_task (y),选择评分最高的响应(例如编程任务中以单元测试通过率为评分);
-
基于大模型的最优选择:直接让大模型从所有候选中选择最优响应(适用于无直接评分函数的场景,如数学证明题)。
2)批次缩放(投票):当最终答案易从响应中提取时,采用多数投票策略,选择出现频率最高的答案。需注意该策略不适用于答案复杂、难以判断等价性的场景(如编程任务);若需基于中间步骤判断正确性,可让大模型从得票最高的答案对应的响应中选择最优解。
3.3.3 轮次缩放
轮次缩放允许模型分 T 轮迭代修正解决方案,每一轮 t,模型基于上一轮 t-1 的解决方案 y^(t-1),在上下文长度 C 内生成新解决方案 y^t。轮次缩放的期望得分即最后一轮解决方案的期望奖励,模型可通过迭代重新评估先前尝试并生成新响应,基于过往经验持续优化。
3.3.4 3D 缩放
1)3D 缩放框架:整合上述三种缩放方法形成统一框架(见图 1)。整个过程包含 T 轮迭代,初始提示 p0=x;每一轮 t 从包含原始问题和过往经验上下文摘要的提示 pt 开始,生成 B 个上下文长度为 C 的独立响应;通过聚合函数 A 聚合 B 个响应生成本轮上下文摘要,下一轮提示 pt+1 由原始问题 x 和上下文摘要拼接而成;最终解决方案从最后一轮的聚合结果中提取。

图 1 测试时缩放的三个维度:上下文、批次、轮次示意图。
2)3D 缩放实现方式:不同聚合函数和配置对应不同实现变体:
-
3D 缩放(大模型评判):每轮生成 B>1 个响应,选择一个正样本和一个负样本作为上下文摘要(正样本为大模型选择的最优响应,负样本为随机选择的其他响应),最终解决方案为最后一轮的正样本;
-
3D 缩放(人类评判):引入人类在环机制,由人类专家作为聚合函数,评估模型响应并选择最优 / 最差响应作为聚合结果,最终解决方案为最后一轮人类选择的正样本,该方法在大模型无法可靠识别最优响应时效果显著。
四、实验
实验分为三个阶段:首先在 IMO 问题上分析三个维度不同测试计算配置的性能,验证测试时缩放效应;然后验证 3D 缩放对 IMO、CPHO、IOI 等复杂奥林匹克竞赛题的推理能力提升;最后将框架拓展至具身学习领域,结合人类反馈生成更符合人类偏好的机器人控制行为。
4.1 实验设置
1)基础推理模型:
采用 Gemini 2.5 Pro 作为骨干模型,其在复杂问题求解中具备强推理和编程能力;温度固定为 0.1,确保输出的确定性;针对不同领域设计定制化系统提示,用于解决方案生成和反馈学习。
2)测试集:
-
推理求解任务:聚焦严谨的推理和算法求解,包括 IMO(国际数学奥林匹克)、CPHO(中国物理奥林匹克)、IOI(国际信息学奥林匹克),其中 IOI 任务中模型需直接求解问题,无中间提交反馈;
-
创新任务:聚焦具身智能和涌现行为,采用 IsaacGym 的多个机器人强化学习任务,新增 HumanoidJump 任务(让类人机器人做出类人跳跃动作,该任务的奖励设计是开放难题,无量化评判标准)。
3)评估方式:
-
IMO/CPHO:由人类专家严格验证解决方案,仅当最终答案和完整推理过程均有效时判定为正确;
-
IOI:基于官方测试用例评分;
-
创新任务:招募人类志愿者投票选择偏好的行为。
4)批次缩放聚合方法:
-
IMO/CPHO 单轮配置:采用多数投票 + 最优选择,批次规模较大时(如 30 个响应),多数投票可过滤噪声,再通过最优选择确定最终解;
-
IOI 任务:因代码差异大且难以投票,直接采用最优选择策略,对比基于评分和基于大模型的最优选择基线;
-
3D 缩放多轮配置:每轮生成 5 个候选解,采用大模型选择最优响应,兼顾可行性和效率。
5)人类在环反馈:
3D 缩放配置下(B>1),除大模型评判外,可引入人类专家在每轮优化中根据任务目标选择最优解,评估者均为数学、物理、信息学国家级奥林匹克竞赛金牌获得者。
4.2 各维度测试时缩放的性能分析
以 IMO 基准为研究对象,选择 3 道难度适中的题目(排除过难 / 过易),每道题测试 5 次,报告平均准确率;除上下文缩放外,其余实验固定上下文长度为 32k。
4.2.1 单维度缩放分析
分析三个维度的测试准确率:上下文缩放的上下文长度从 1k 增至 32k,批次缩放(投票)的并行样本数从 1 增至 30,轮次缩放(自优化)的优化轮次从 1 增至 10。
结果显示(见图 2),各维度性能在小尺度下提升,但快速趋于饱和,进一步缩放无明显增益:上下文长度超过中等范围后提升微弱,轮次增加的收益递减,批次缩放甚至在大批次规模下性能下降(如 B=30)。这是因为模型推理存在系统性偏差,多数投票会放大偏差而非修正,导致准确率下降。

图 2 IMO2025 数据集平均准确率随总推理预算的变化(单维度缩放):三个维度在小尺度下性能提升显著,但大尺度下趋于饱和。
4.2.2 多数投票的准确率下降现象
IMO 任务的批次缩放实验中发现反直觉现象:批次规模 B 超过 15 后,多数投票的准确率下降(见图 3),与集成学习 “更多样本降低方差、提升准确率” 的直觉相悖。
分析发现,IMO1、IMO5 的准确率随批次规模提升并趋于饱和,但 IMO3 的准确率随批次规模持续下降 —— 模型对错误答案 “2” 的生成概率高于正确答案 “4”,批次规模越大,多数投票越易选中错误答案,导致准确率下降。这一现象可通过定理验证:若模型生成错误答案的概率高于正确答案,多数投票的准确率随批次规模增大趋近于 0,说明多数投票并非绝对可靠,甚至会放大模型偏差。

图 3 IMO 问题的批次缩放分析:(a)不同批次规模下各 IMO 题目的平均准确率;(b)IMO3 中多数投票的失效模式,模型偏向错误答案 “2”,批次规模越大越易选中错误答案。
4.2.3 3D 缩放分析
采用大模型评判的简单偏好聚合函数,开展批次 - 轮次组合的 3D 缩放实验(见图 4)。结果显示,3D 缩放的性能超越单维度缩放的上限,最高准确率达 73.3%;增加轮次初期可稳定预测结果,但进一步增加会导致饱和甚至准确率下降(单轮错误判断会传导至后续轮次);批次规模从 1 增至 5 时性能显著提升,增至 8 时下降(候选解过多导致大模型无法正确识别最优 / 最差解)。
引入人类评判的 3D 缩放(C=32768、B=5、T=3),准确率进一步提升至 86.7%,验证人类反馈的显著增益。核心洞察:
1)缩放饱和:各单维度缩放的性能提升均有上限,上下文缩放因信息利用边界快速饱和,轮次缩放迭代后收益递减,批次缩放过大则性能下降;
2)突破单维度边界:多维度组合可超越单维度性能上限,不同缩放形式可互补而非重叠,探索新的缩放维度是提升推理系统能力的重要方向。

图 4 IMO2025 数据集平均准确率随总推理预算的变化(3D 缩放):3D 缩放性能超越单维度上限,人类评判的 3D 缩放准确率达 86.7%。
4.3 3D 缩放在基准任务中的评估
采用 B=5、T=3 的配置,开展大模型 / 人类评判的 3D 缩放实验,对比方法均保证相同总令牌预算,结果以雷达图展示(见图 5)。
4.3.1 数学奥林匹克(IMO 2025)
上下文缩放仅取得中等性能,模型虽能生成合理答案,但推理过程常不完整;批次缩放(投票)、轮次缩放(自优化)在单维度缩放中提升准确率,但规模增至 15 后趋于饱和;3D 缩放(大模型评判)性能优于基线,3D 缩放(人类评判)表现最优,人类反馈可修正模型推理不完整的问题,通过迭代优化生成完全正确的解决方案。
4.3.2 物理奥林匹克(CPHO 2022)
结果趋势与数学奥林匹克一致:3D 缩放(人类评判)准确率最高,其次是 3D 缩放(大模型评判)、批次缩放(投票)、上下文缩放。物理题的评估特点:最终答案难以猜测,正确答案通常代表推理过程有效,评估主要依赖最终答案;自优化迭代中,模型更易修改最终答案,反映物理题求解的不确定性更高。
4.3.3 编程(IOI 2025)
排除无法访问提交 API 的通信类题目后,IOI 2025 铜牌分数线为 252 分,3D 缩放(人类评判)得分 221.53(约前 60%)。上下文缩放仅能解决部分任务,且易出现复杂度分析错误;批次缩放对比基于评分 / 大模型的最优选择,显示批次缩放的上限;3D 缩放(人类评判)表现最优,即使初始解错误,也能识别代码问题并迭代修正,得分比基于评分的批次缩放高约 19.9%;3D 缩放(大模型评判)虽精度低于人类评判,但仍优于上下文缩放,验证自动反馈机制提升代码生成的可行性。

图 5 不同测试时缩放方法的综合对比:覆盖数学奥林匹克(IMO2025)、物理奥林匹克(CPHO2022)、编程(IOI2025)、具身学习(IsaacGym)四大领域,人类评判的 3D 缩放持续优于基线。
4.4 创新任务实验
在 IsaacGym 的机器人强化学习任务(Cartpole、BallBalance、Quadcopter、Ant、Humanoid、ShadowHand、AllegroHand)及新增的 HumanoidJump 任务(类人机器人类人跳跃)中,评估人类反馈的效果。采用 GPT-4o 作为骨干模型,生成任务专属奖励函数并训练仿真器中的智能体;3D 缩放(人类评判)配置为 B=6、T=5,每轮评估者根据智能体行为视频选择最优 / 最差奖励函数,同时结合大模型自动反馈辅助优化。
4.4.1 任务指标
IsaacGym 任务采用 PPO 训练流程中的奖励函数,以专家设计的任务指标平均值为真实奖励;HumanoidJump 任务无金标准奖励,采用人类投票量化评估。
4.4.2 IsaacGym 任务结果
3D 缩放(人类评判)在 5 个复杂任务中的 3 个显著优于基于评分的批次缩放,平均提升 18.4%;代理评判的 3D 缩放(以人类设计的专家奖励为代理)平均提升 27.4%,且方差更低,奖励学习行为更稳定。
4.4.3 HumanoidJump 任务结果
无人类反馈时,机器人最常见的是 “单腿抬起跳跃”,仅满足 “离地” 的基础指标,无法进化为类人跳跃;引入人类偏好反馈后,志愿者基于整体跳跃质量而非仅离地指标选择,引导机器人进化出双腿弯曲、上半身下压的类人跳跃动作。
20 名志愿者的偏好投票显示,17 人偏好 3D 缩放(人类评判)生成的行为,验证该方法可生成更符合人类偏好的行为。
五、结论与开放问题
本文从缩放规律视角重新审视推理模型的测试时增强技术,将现有方法统一至多维度测试时缩放框架,验证上下文、批次、轮次三个正交维度的缩放规律,提出的 3D 测试时缩放可显著拓展测试时计算的有效上限。实验表明,该框架不仅提升 IOI、IMO、CPHO 等复杂基准的推理准确率,还支持人类在环范式,并可拓展至具身学习领域,实现类人机器人控制行为的发现。
仍存在重要开放问题:尽管已发现三个核心缩放维度,测试时计算的能力仍受架构和计算约束,是否存在其他缩放维度进一步释放大模型推理潜力,是未来的重要研究方向。
END
更多推荐

所有评论(0)