2026大模型技术前沿:测试时训练、评估危机与架构创新
引言
2026年过半,大模型行业最深刻的变化,不是参数又翻了多少倍,而是整个技术范式正在经历一场从“静态训练”到“动态适应”、从“刷榜竞赛”到“评估危机”的深刻转型。
当模型能力逐渐逼近人类基线,传统基准大规模饱和,行业开始重新审视“好模型”的定义。与此同时,测试时训练(Test-Time Training, TTT)作为一种让模型在推理阶段动态更新自身参数的新范式,正在从学术概念走向工程现实。
本文将从测试时训练的技术突破、模型评估体系的系统性危机、架构创新的持续推进三个维度,盘点2026年大模型领域最值得关注的技术变革。
一、测试时训练(TTT):让模型在推理中持续学习
1.1 什么是测试时训练?
传统的“训练-部署”范式有一个根本性局限:模型一旦部署,参数便永久冻结,无法根据实际输入的上下文进行动态调整。测试时训练(TTT)提供了一种替代方案——在推理阶段更新部分模型参数(通常称为“快速权重”),让模型在处理具体任务时动态适配当前上下文。
TTT的核心思路是:将长文本建模从架构设计问题转化为“持续学习”任务。模型在测试阶段基于当前读取的上下文进行下一个词预测,每读取一段文本就通过梯度下降更新自身参数,把读到的文本信息动态压缩到权重中。
1.2 英伟达TTT-E2E:128K上下文提速2.7倍
2026年1月,英伟达联合Astera研究所、斯坦福大学、UC伯克利等机构推出了TTT-E2E方法。该方法基于带滑动窗口注意力的标准Transformer,容易部署。
在训练阶段,团队通过元学习为模型做初始化准备——把每个训练序列都模拟成测试序列,先在内循环中对其进行测试时训练,再在外循环中优化模型的初始参数,确保初始状态就能快速适配测试时的学习需求。
为了平衡效率与稳定性,TTT-E2E设计了三项关键优化:
-
迷你批处理+滑动窗口:将测试时训练数据分成多个迷你批,配合8K大小的滑动窗口注意力
-
精准更新策略:只更新模型的MLP层,且只更新最后1/4的网络块
-
双MLP设计:静态MLP存储预训练知识,动态MLP负责吸收新上下文
实验数据显示,TTT-E2E在3B参数模型上处理128K上下文时,速度比全注意力模型快2.7倍,处理2M上下文时提速达35倍。推理延迟不随上下文长度增加而变化,无论处理8K还是128K文本,用户都能获得一致的快速响应体验。
1.3 In-Place TTT:让大模型“原地改参数”
传统TTT存在三大瓶颈:架构不兼容(需引入全新网络层)、计算效率低(逐Token更新)、优化目标不匹配(用重建目标而非“预测下一个Token”)。
2026年4月,字节Seed与北京大学在ICLR 2026 Oral论文中提出了In-Place TTT(原地测试时训练)。核心思路极其巧妙:不新增层,不改架构,直接把Transformer里本来就有的MLP模块当成“临时小脑”。具体来说,将MLP的最后一个投影矩阵作为快速权重,在推理时进行原地更新。
实验证明,Qwen3-4B、Llama3.1-8B、Qwen3-14B在装备In-Place TTT之后,在长文本任务上提升尤为明显。该方案让TTT可以作为即插即用的模块,无缝集成到现有的预训练大模型中,无需从头训练。
1.4 Large Chunk TTT:把更新块拉到百万Token量级
ICLR 2026上,另一项TTT研究提出了Large Chunk Test-Time Training (LaCT) ——将更新块大小从传统的16或64个Token扩大到2K到1M Token。
现有TTT方法因使用极小的在线迷你批大小,GPU的FLOPs利用率往往低于5%。LaCT通过大幅增加更新块大小,将硬件利用率提升了数个量级,并允许非线性状态大小扩展到模型参数大小的40%,无需编写复杂的内核实现。在最长序列实验中,该方法在超过100万Token的上下文上进行了新视图合成。
1.5 WAM-TTT:具身智能的后训练新框架
2026年7月15日,银河通用发布全球首个具身智能大模型后训练框架WAM-TTT。该框架创新运用人类第一视角视频替代昂贵的机器人遥控数据,实现零标注快速适应新环境,泛化率达76%,显著超过硅谷Physical Intelligence的π0.5模型。
二、评估危机:当标尺开始熔化
2.1 近半基准已经饱和
2026年初,一项发表在arXiv上的系统性研究分析了60个主流大语言模型基准,结论令人不安——近一半的基准已经饱和,排名靠前的模型得分趋同,基准失去区分能力。更讽刺的是,隐藏测试集对防止饱和几乎没有任何保护效果。
具体数据触目惊心:
-
Math-500:o3拿到99.2分,Grok-4拿到99.0,DeepSeek R1拿到98.3——三个完全不同架构的模型挤在一个百分点的空间里
-
MMLU:当前顶级模型达到约88%准确率,人类专家基线是89.8%,差距不到两个百分点
最具象征意义的事件发生在2026年2月:OpenAI宣布停止报告SWE-Bench Verified的成绩——一个由OpenAI自己投入近100名软件工程师清理和策划的基准,最终被自己宣布退役。
2.2 数据污染已成系统性现象
加州大学伯克利分校、卡内基梅隆大学和Vectara的联合研究发现,包括MMLU、GSM8K、HumanEval在内的主流基准测试中,题目和答案广泛存在于GPT-4、Llama 2、Mistral等模型的预训练数据中。当Common Crawl快照覆盖了互联网的大部分公开文本,任何公开的测试题目早晚会成为训练数据的一部分。
2.3 新评估范式的探索
面对评估危机,研究者正在探索新的评估方法:
-
SEAL(LLM-as-a-Meta-Judge):将饱和基准的评估重新定义为固定候选的重排序问题,用LLM作为元评判器来区分接近的模型分数
-
GIM(Grounded Integration Measure):包含820道原创问题(615道公开,205道私有),难度来自多个认知领域的整合
-
Code2Bench:北航提出的“双重扩展”动态评测框架,打破代码大模型的“高分幻觉”
-
BrowseComp:OpenAI于2026年推出的新基准,专门评估模型在实时互联网浏览场景下的信息检索和推理能力
当标尺熔化,谁能定义新的衡量标准,谁就掌握了定义“好模型”的话语权。
三、架构创新:稀疏注意力与持续学习
3.1 腾讯混元HiLS-Attention:稀疏注意力首次被“做对”
2026年7月20日,腾讯混元团队正式开源HiLS-Attention(分层地标稀疏注意力) 。该方法首次在数学层面上同时解决了chunk重要性估计的“表达力不足”和选择过程的“端到端不可导”两大根本难题。
核心创新分为两步:
-
利用一阶泰勒展开构造chunk重要性估计函数,引入“熵偏置”项,在任意logit分布下自适应贴合真实重要性
-
将注意力权重分层因式分解为两级softmax——chunk间softmax决定整体注意力分配,chunk内softmax决定token间相对权重
实验数据令人震撼:
-
仅用8K训练即可实现4M上下文(512倍)的免训外推
-
512K上下文下prefill快13.5倍、单步decode快15.7倍
-
在部分长上下文检索任务上反超了全注意力本身——变量追踪等多跳任务高出多达50%
研究团队解释,压缩本身具有去噪效果:无关token的微小噪声在压缩中相互抵消,共享语义信号被保留。
3.2 MiniMax MSA:百万token成本降至1/20
MiniMax通过自研稀疏注意力(MSA)架构,成功将百万字长文本的单位Token计算成本降至传统全注意力机制的约1/20。MSA的思路类似于“精准派单”——不再激活全部模型,而是只调动最相关的几个专家模块。该架构已在MiniMax新一代文本模型M3上落地。
3.3 Macaron-V1:持续学习挑战Scaling Law
2026年7月21日,心洲科技Mind Lab正式开源Macaron-V1,在智谱GLM-5.2的千亿参数基座之上,通过LoRA插件式架构实现了模型的“持续学习”与“群体智能”。
Mind Lab提出的“经验智能机器”理念认为:机器应从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题——智能由此成为一个持续生长的过程。Macaron-V1的Mixture-of-LoRA(MoL)架构将不同技能的任务分配到不同LoRA专家,新能力以插件式加入,不动摇已有知识。
在UI4A等基准测试中,Macaron-V1全面超越基座GLM-5.2,甚至大幅领先Claude Opus 4.8。
更令人震撼的是群体智能实验:
-
单个adapter在AIME24上准确率36.44%
-
198个不同adapter做多数投票,准确率提高到48.67%
-
同一adapter重复采样最高只到43.78%
不同学习轨迹带来的差异包含了超出普通采样的互补性——群体不是简单的重复,而是真的更聪明。
四、蚂蚁Ling-3.0-Flash:智效比的极致追求
7月24日,蚂蚁百灵发布Ling-3.0-Flash——总参数量124B,单次计算激活仅5.1B(约为上一代1T级旗舰Ring-2.6-1T的8.1%),却实现了全方位的能力对标甚至超越。
关键技术创新:
-
混合注意力架构:以5:1比例交替堆叠KDA线性注意力层与MLA层
-
KDA升级:在Delta Rule的状态更新中引入细粒度对角门控
-
专家激活压缩:每个Token的专家激活比例从1/32压缩至1/64
-
Agent场景优化:扩展超10000个真实交互训练环境
在响应速度上,通过引入集群级分级缓存,长输入下的首字响应延迟降低了60%至80%以上。该模型已上线OpenRouter,之后将正式开源。
写在最后
2026年的大模型技术图景,可以用三个关键词概括:
“动态”——测试时训练让模型在推理阶段持续学习。英伟达TTT-E2E让128K上下文提速2.7倍,字节In-Place TTT让大模型“原地改参数”,银河通用WAM-TTT用人类视频训练具身智能。模型不再是一次性训练的静态产物,而是持续进化的动态系统。
“重构”——评估体系正在经历系统性崩溃。近半基准已饱和,OpenAI退役了自己清理的SWE-Bench。SEAL、GIM、Code2Bench等新范式正在重新定义“好模型”的标准。当标尺熔化,定义标尺的人掌握话语权。
“收敛”——架构创新从“更大”走向“更聪明”。HiLS-Attention让稀疏注意力反超全注意力,MSA将长文本成本砍至1/20,Macaron-V1用持续学习挑战Scaling Law,Ling-3.0-Flash用5.1B激活参数对标1T级旗舰。不再盲目堆参数,而是让每一份算力都用在刀刃上。
当模型能力趋于收敛,谁能用更低的成本、更快的速度、更聪明的架构输出同样的智能,谁就能赢得下一阶段的竞争。这不是参数的战争,这是效率与智能的战争。
更多推荐

所有评论(0)