引言

2026年7月,大模型行业最深刻的变化,不是参数又翻了多少倍,而是整个技术范式正在经历一场从“静态”到“动态”的根本性转移

过去三年的AI叙事有一条清晰的主线:训练一次,部署一次,然后祈祷它一直好用。模型能力基本都是在少数几次集中训练中获得的,训练结束后参数冻结,以固定状态进入部署。

但2026年,这条主线正在被撕裂。持续学习让模型在部署之后继续成长;动态推理让模型学会该快则快、该深则深;新架构试图从根上动摇Transformer的统治;端侧芯片让大模型真正走进物理世界。

本文将从持续学习与群体智能、推理效率的动态化、架构创新的多元化、端侧部署的工程化四个维度,系统梳理2026年大模型领域正在发生的范式转移。

一、从“一次性训练”到“持续学习”

1.1 “经验时代”的到来

2025年,图灵奖得主、强化学习之父Richard Sutton与David Silver在一篇著名博文中,直接将AI的下一阶段命名为 “经验时代”(The Age of Experience) 。2026年7月,Sutton正式下场创业,方向正是持续学习Agent。

这一判断的背后是一个残酷的现实:今天最有价值的信息,往往是在模型部署之后才会涌现的——用户的长期偏好、代码库的独特架构、任务反复失败的原因,这些都无法在训练阶段被捕捉。

Mind Lab提出的 “经验智能机器” 理念给出了一个清晰的愿景:机器应从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题,更难的问题又带来更丰富的经验——智能由此成为一个持续生长的过程

1.2 Macaron-V1:可插拔的持续学习

2026年7月21日,心洲科技旗下Mind Lab正式开源Macaron-V1,在智谱GLM-5.2的千亿参数基座之上,通过Mixture-of-LoRA(MoL)架构实现了模型的持续学习与群体智能。

MoL的设计思路极其直观:技能相近的任务归进同一个LoRA相互强化,技能差异大的分到不同LoRA各自独立。旗舰版Venti(748B总参数)在冻结的GLM-5.2基座上搭载了四个1B的LoRA专家——对话、Agent、代码和UI生成。新能力以插件式LoRA加入,不动摇已有知识

在UI4A等基准测试中,Macaron-V1全面超越基座GLM-5.2,甚至大幅领先Claude Opus 4.8。

1.3 群体智能:198个LoRA协作超越单体

一旦模型能持续学习,不同实例就会逐渐走向不同方向——多样性成为自我迭代的自然结果。

Mind Lab的实验给出了有力证据:从相同的Qwen3-30B基础模型出发,只改变数据顺序。在AIME24上,单个adapter准确率是36.44%;把198个不同adapter做多数投票,准确率提高到48.67%;而同一adapter重复采样最高只到43.78%。

这说明不同学习轨迹带来的差异包含了超出普通采样的互补性——群体不是简单的重复,而是真的更聪明

二、推理效率的“动态化”

2.1 E-GRM:拿不准才多想,拿得准直接答

生成式奖励模型(GRM)是当前LLM推理增强的重要方向——通过Chain-of-Thought让模型在输出答案前先走一遍推理链。但有个明显问题:无论问题简单还是复杂,GRM一律要求走完整条CoT。

腾讯混元团队在ACL 2026上发表的E-GRM给出了一个优雅的解法。核心思路:用模型自身的输出一致性来判断输入复杂度——对同一个prompt用不同温度参数并行解码5次,如果答案高度一致就直接回答,如果五花八门才触发CoT深度推理。

在RM-Bench、RMB、RewardBench三个基准上,约58%的样本被智能路由到“直答” ,延迟降低62% ,同时准确率还有提升。

2.2 JetSpec与DSpark:推测解码的“双雄会”

推测解码的核心是用轻量级草稿模型快速生成候选token,再由目标模型并行验证。2026年6-7月,两个几乎同时出现的技术突破将这一方法推向新高度。

DeepSeek DSpark更关注推理服务中的验证效率,在真实生产系统中实现了60%-85%(Flash模型)和57%-78%(Pro模型)的速度提升。

阶跃星辰JetSpec则从草稿生成本身入手,用因果并行树生成提高单次验证能接受的Token数。在Qwen3-8B上,JetSpec相比标准自回归解码最高实现9.64倍端到端解码加速。这种加速覆盖了数学(MATH-500)、代码(HumanEval、LiveCodeBench)和对话等多种任务。

值得一提的是,这两篇论文均有行业技术大佬坐镇——DSpark作者栏出现了梁文锋的名字,JetSpec作者栏则出现了阶跃星辰CEO姜大昕和CTO朱亦博。

2.3 TRACE:把rollout预算用在刀刃上

大模型的强化学习后训练(RLVR)成本极高——在Agentic场景中,模型要一步步思考、调用工具、接收环境反馈,每一次完整交互都是一次rollout。更麻烦的是,不是所有rollout都同样有用。

清华与腾讯混元团队提出的TRACE不再把rollout预算平均撒到每个prompt上,而是把Agent轨迹看成一棵树,主动把预算分配给那些最可能产生“成功/失败对比”的prompt根节点和中间前缀节点。

实验显示,在Qwen3-14B的多跳问答上,TRACE将平均准确率从GRPO的51.2提升到54.0;在Qwen3-8B的数学任务上,将有效样本比例从26.8%提升到60.6%

三、架构创新的多元化

3.1 CoFrGeNets:用连分数重构Transformer

2026年7月,IBM Research在ICML 2026上发布了一种全新的模型架构——CoFrGeNets(连分数生成网络) 。

该架构以连分数这一数学表示方法为核心,取代了Transformer中的多头注意力机制和前馈网络。连分数通过嵌套的除法序列表达一个值,能够以紧凑的方式捕捉复杂数学关系,用远少于传统神经网络的参数量来近似非常复杂的函数。

实验结果令人瞩目:在下游分类任务中,CoFrGeNet变体在参数量远少于对手(通常少数亿个参数)的情况下,性能与GPT2-xl持平甚至略胜一筹。即便在更大规模的Llama-3.2B实验中,CoFrGeNet在开放域问答和推理等任务上依然保持竞争力,同时体量更小、训练更快。

当然,连分数在GPU上存在计算成本高和数值不稳定的挑战——研究团队采用了一种名为“clamping”的技术来保证数值稳定性。

3.2 SSA:13人团队,算力暴减千倍

5月,迈阿密初创公司Subquadratic——全公司仅13人——发布了基于SSA(亚二次方稀疏注意力)架构的模型SubQ,上下文高达1200万Token

SSA的核心思路极其简单:既然训练好的模型中绝大多数注意力权重都接近零,为什么还要算它们?它对每一个query基于 “内容” 选择真正值得关注的位置,只在这些位置上精确计算注意力,跳过其余99%以上的无用计算。

三大关键特性:线性扩展(上下文翻倍成本只翻倍)、内容依赖路由(模型根据语义决定看哪里)、精确检索(保留从任意位置取回信息的能力)。

实验数据令人震撼:在100万token上下文下,SSA比标准密集注意力+FlashAttention-2快52.2倍。在1200万token下,注意力FLOP减少了接近1000倍。在RULER 128K基准测试上,SubQ花费8美元,Opus为2600美元——300倍的成本差距

AI大佬Bindu Reddy评价道:“若这一切都是真的,Anthropic和OpenAI的估值直接归0。”

四、端侧部署的工程化

4.1 存算一体芯片:10W功耗跑120B模型

大模型走向端侧,最大的瓶颈不是算力TOPS,而是功耗、内存带宽和数据搬运。2026年WAIC上,后摩智能展出的存算一体芯片M50给出了一个突破性答案——在10W功耗下实现160TOPS单芯片算力,可流畅运行30B至120B参数量级大模型。

存算一体架构从根本上缓解了“内存墙”问题。联想AI主机P7搭载M50芯片,在手掌大小的机身中综合算力达190TOPS,可离线流畅运行高达1220亿参数大模型,无网络环境下本地推理速度达到50Tokens/s

4.2 Ling-3.0-Flash:124B参数,5.1B激活

7月24日,蚂蚁百灵发布Ling-3.0-Flash——总参数量124B,单次计算激活仅5.1B。在大幅精简体量的同时,在基础推理、指令遵循及长文本处理等核心指标上对标甚至超越了参数规模达其2至3倍的行业领先模型。

实现“小体量、高智能”的关键在于底层架构的重新设计:从预训练阶段即采用混合注意力架构,以5:1比例交替堆叠KDA线性注意力层与MLA层;每个Token的专家激活比例从前代的1/32压缩至1/64

针对Agent场景,模型扩展了超10000个真实交互训练环境,优化了复杂任务的自我纠错与长程规划机制。通过引入集群级分级缓存,长输入下的首字响应延迟降低了60%至80%以上

该模型已上线OpenRouter限时免费一周,之后将正式开源。

写在最后

2026年的大模型技术图景,可以用一句话概括:从“静态”到“动态” 。

持续学习让模型不再是训练一次就冻结的“死物”——Macaron-V1的MoL架构证明,模型可以在部署之后继续成长,不同学习轨迹的多样性还能催生群体智能。Richard Sutton下场创业持续学习Agent,标志着“经验时代”正在从理论走向实践。

推理效率正在从“一刀切”走向“动态适配”——E-GRM让模型自己判断该快答还是该深想,JetSpec和DSpark从不同方向突破推测解码的效率天花板,TRACE把宝贵的rollout预算精准投放到最需要的地方。

架构创新正在打破Transformer的单一叙事——CoFrGeNets用连分数重构了Transformer的核心组件,SSA用亚二次方稀疏注意力实现了千倍级的算力削减。九年前Transformer横空出世时无人能预料它的统治如此之久,2026年我们或许正在见证下一个范式的起点。

端侧部署正在从“能不能跑”走向“跑得好不好”——存算一体芯片M50用10W功耗驱动120B模型,Ling-3.0-Flash用5.1B激活参数对标2-3倍体量的模型。大模型正在从数据中心走向手掌之间。

当模型能力趋于收敛,谁能用更动态的方式让模型持续学习、用更聪明的方式分配推理算力、用更高效的架构突破物理极限,谁就能赢得下一阶段的竞争。这不是参数的战争,这是范式的战争。

更多推荐