大模型2026:当“静态智能”走向“动态进化”
引言
2026年7月,两件看似无关的事同时发生,却共同指向了大模型行业最深层的变革。
一件发生在韩国首尔。ICML 2026将最高荣誉——杰出论文奖——同时颁给了两篇扩散模型论文。其中一篇来自清华大学黄高团队,标题带着杀气——《灵活性陷阱:重新思考扩散语言模型中任意顺序的价值》。它用大量实验证明,扩散语言模型最引以为傲的“任意顺序生成”非但没有带来预期收益,反而成了陷阱。另一篇来自MIT和耶鲁,聚焦扩散模型的采样精度。两篇论文,一篇拆掉核心假设,一篇推高技术天花板——ICML同时奖励“破”与“立”,信号再清晰不过。
另一件发生在上海。WAIC 2026上,北京智源人工智能研究院联合端侧智能北京市重点实验室发布报告,宣告2026年是端侧AI规模化落地的元年。大模型正在从以云端为唯一算力中枢的单点智能,走向端云分工、协同共生的分布式智能系统。面壁智能联合创始人、CEO李大海在论坛上给出一个关键数据:大模型的能力密度约每3.5个月翻一番。不是越大越好,而是越密越好。
这两件事共享同一个底层逻辑:大模型行业正在从“静态”走向“动态”。模型架构在动态调整,学习方式在动态进化,部署形态在动态扩散。
一、架构之变:当“灵活性”变成“陷阱”
1.1 扩散模型的“灵活性陷阱”
扩散语言模型是2026年最受关注的下一代语言模型架构之一。Google的Gemini Diffusion、中国人民大学的LLaDA均属于这一技术路线。
与GPT、Claude这类自回归模型从左到右逐个token生成不同,扩散语言模型像画画一样从噪声中逐步“去噪”出完整文本。理论上,这种架构有个巨大优势:生成顺序可以任意——先写中间再写开头,先定结论再补论据。过去两年,大量论文把“任意顺序”当作扩散LLM优于自回归LLM的关键论据。
但黄高团队的研究揭示了一个反直觉的现象:任意顺序生成非但没有扩展dLLM的推理边界,反而使其收窄。模型会利用顺序自由绕开对探索至关重要的高不确定性token,导致解空间过早坍缩。
问题出在推理的“分叉口”。论文作者之一解释道:不确定性高的关键逻辑节点(如“因此”“所以”)像是一个分叉口。若采用从左向右的顺序,模型必须在此处当场作出选择。若采用任意选择生成顺序,模型会倾向于绕过这些难点,优先处理容易的部分。等回头再填充这些节点时,前后文已经确立,原本的推理分叉口变成了填空题——答案被上下文锁定了。
实证数据给出了致命一击:在HumanEval代码生成任务上,从左往右顺序能解出、而任意顺序解不出的题目占21.3%,反向仅0.6%。顺序的自由度越大,推理性能越差。
基于这一发现,团队提出的解决方案是“JustGRPO”——在强化学习训练阶段放弃任意顺序,强制模型从左到右生成。训练完成后在GSM8K上达到89.1%准确率,全面超越所有为扩散模型专门设计的复杂强化学习算法。
ICML把最高荣誉颁给一篇“拆台”的论文,传递的信号很清楚:扩散模型已经进入了需要“纠偏”和“补基建”的阶段。下一代语言模型架构之争中,扩散模型已正式入局。
1.2 单层RL超越全参数训练:另一个“纠偏”
同样在ICML 2026上,明尼苏达大学、北京大学和亚马逊的团队挑战了另一个长期假设。过去,RL后训练的收益被认为均匀分布在所有Transformer层——要训练就得更新全部参数。
但通过对7个模型、跨越2个模型家族、3种RL算法、3个任务领域的系统性逐层研究,团队发现RL收益高度集中在一小部分中间层,而非均匀分布。更令人惊讶的是,训练单个Transformer层即可匹敌甚至超越全参数RL训练。
这意味着RL后训练不再需要更新全部参数,只需精准更新关键层,就能用更少的计算成本获得同等甚至更好的效果。这又是一个从“静态全量”走向“动态精准”的案例。
二、学习之变:从“一次性训练”到“持续进化”
2.1 Macaron-V1:挑战Scaling Law
2026年7月21日,心洲科技旗下Mind Lab正式开源Macaron-V1。它在智谱GLM-5.2的千亿参数基座之上,通过LoRA插件式架构实现了模型的 “持续学习”与“群体智能” 。
这一做法挑战了行业长期以来的Scaling Law信仰——不靠堆参数,而靠自我迭代来提升能力。
Mind Lab提出的 “经验智能机器” 理念认为:机器应从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题——智能由此成为一个持续生长的过程。
Macaron-V1的Mixture-of-LoRA架构将不同技能的任务分配到不同LoRA专家,新能力以插件式加入,不动摇已有知识。在UI4A等基准测试中,Macaron-V1全面超越基座GLM-5.2。
更令人震撼的是群体智能实验:从相同的Qwen3-30B基础模型出发,只改变数据顺序。在AIME24上,单个adapter准确率是36.44%;把198个不同adapter做多数投票,准确率提高到48.67%。不同学习轨迹带来的差异包含了超出普通采样的互补性——群体不是简单的重复,而是真的更聪明。
2.2 自进化Agent:让AI自己越用越聪明
持续学习的理念正在从模型层面延伸到Agent层面。2026年,自进化Agent成为行业热点。
所谓自进化Agent,指的是一类能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。简单来说:让Agent自己越用越聪明,而不是每次都靠人工去喂数据、调提示词、改模型。
2026年初,OpenClaw(龙虾)的爆火让人们看到了个人AI助理普及的可能。从“被动等待提示词的代码工具”走向“学会记忆、自我改进、持续进化的智能体”——智能体自我进化正在提速。
三、部署之变:从“云端唯一”到“端云协同”
3.1 密度定律:端侧AI的底层逻辑
端侧AI之所以能在2026年从“少数派选择”变成“产业最大共识”,背后是一条被反复验证的规律——密度定律。
2024年底,清华大学相关团队与开源社区OpenBMB提出“能力密度”概念,成果于2025年作为封面文章发表于《自然》。密度定律的结论极具穿透力:大模型的最大能力密度随时间呈指数增长,约每3.5个月翻一番。
芯片在同等价格下的算力约每两年翻一倍,而模型的能力密度约每百天翻一倍。两条曲线的交汇,把“高性能大模型装进终端”从设想变成工程现实。
截至2026年7月,MiniCPM系列全球下载量突破3800万次、GitHub星标超过14万。其2026年5月发布的MiniCPM5-1B,仅以1B参数规模,在国际权威榜单上取得17.9分的成绩,与2024年5月发布的200B参数GPT-4o仅相差零点几分。
参数规模不再是荣誉勋章,“单位参数、单位能耗下的智能产出”才是新的硬指标。
3.2 四重倒逼:为什么偏偏是2026年?
产业向端侧集体转向,背后是四重现实约束的倒逼:
成本方面,截至2026年6月,豆包大模型日均Token调用量已突破180万亿,较去年增长超10倍,云端推理经济性持续承压。
时延方面,自动驾驶要求10-50毫秒级响应,云端往返无法满足。
隐私方面,《个人信息保护法》与GDPR持续收紧,敏感数据“不出端”成为刚需。
稳定性方面,弱网、断网环境下纯云端方案存在可用性短板。
业界正在形成的共识,是 “端侧为主、云端为辅,优先在本地处理、解决不了再上云”的混合架构。ZEDEDA 2026年边缘AI调查显示,47%的企业已采用混合云-边缘架构。
3.3 FlagOS:打通端侧落地的“最后一公里”
端侧智能的能力供给已就绪,真正卡住规模化落地的,是部署侧的碎片化。端侧芯片架构天然多元——NPU、GPGPU、DSA、RISC-V AI、ARM等并存,形成“N种模型×M种芯片×K种终端”的组合。
北京智源人工智能研究院牵头打造的众智FlagOS开源统一软件栈,为这一根本性矛盾给出了工程解法。2026年6月发布的FlagOS 2.1,已实现对18家厂商、32款AI芯片的全场景支持,成为全球支持芯片种类最多的AI系统软件栈。
四、系统之变:从“芯片竞赛”到“系统竞赛”
4.1 评估体系的“标尺熔化”
当模型能力快速逼近人类基线,评估体系正在经历系统性危机。2026年初,一项发表在arXiv上的系统性研究分析了60个主流大语言模型基准,结论令人不安——近一半的基准已经饱和。
MMLU得分从2022年的70%攀升到2025年的90%以上,前沿模型之间的区分能力几乎消失。最具象征意义的事件发生在2026年2月:OpenAI宣布停止报告SWE-Bench Verified的成绩——一个由OpenAI自己投入近100名软件工程师清理和策划的基准,最终被自己宣布退役。
当标尺开始熔化,谁能定义新的衡量标准,谁就掌握了定义“好模型”的话语权。
4.2 超节点:算力竞争的新范式
在WAIC 2026上,超节点成为全场焦点。据不完全梳理,超过20家企业发布了与超节点相关的产品或方案。
随着大模型参数从千亿走向万亿乃至十万亿,传统8卡服务器已无法满足训练和推理的通信需求。超节点将大量GPU或加速卡从“多台服务器”深度整合成逻辑上像一台“超级计算机”的系统。
华为首次线下展示了昇腾950超节点真机——1024张NPU卡高速互联,能够提供1 EFLOPS FP8、2 EFLOPS FP4的澎湃算力。中科曙光展示了640卡超节点,百度天池、阿里云灵骏真武M890、浪潮信息元脑均被放在各自展台的突出位置。
超节点的价格比同样卡数服务器总价要贵,但客户算的是总体效能账——算力密度更高、空间占地更小。大模型竞争正从芯片性能比拼,升级为全栈系统能力的较量。
写在最后
2026年的大模型技术图景,正在经历一场从“静态”到“动态”的深刻转型。
架构从静态走向动态——扩散模型的“灵活性陷阱”证明,架构设计需要重新审视“自由”与“约束”的辩证关系。单层RL超越全参数训练证明,精准比全面更重要。
学习从静态走向动态——Macaron-V1用持续学习挑战Scaling Law,自进化Agent让AI自己越用越聪明。模型不再是训练一次就冻结的“死物”,而是可以持续成长的“活系统”。
部署从静态走向动态——密度定律让大模型从云端走向终端,端云协同的混合架构正在成为新常态。FlagOS统一软件栈正在打通端侧落地的最后一公里。
系统从静态走向动态——评估体系在饱和中重构,超节点在算力竞赛中崛起。竞争不再是单一维度的比拼,而是系统能力的全面较量。
当模型能力趋于收敛,谁能用更动态的方式让模型持续进化、用更聪明的方式分配计算资源、用更系统的视角构建技术栈,谁就能赢得下一阶段的竞争。这不是参数的战争,这是动态智能的战争。
更多推荐


所有评论(0)