2026大模型技术观察:世界模型崛起与架构范式转移
引言
2026年过半,大模型行业最深刻的变化,不是参数又翻了多少倍,而是整个技术路线正在经历一场从“语言智能”到“物理智能”的范式转移。
Transformer统治AI行业已经九年。从GPT到Claude到Gemini,所有前沿大模型都建立在同一个基础上:密集注意力机制。但这条路正在逼近极限——标准深度Transformer的底层物理与算法瓶颈正日益凸显。
与此同时,一个全新的技术方向正在崛起:世界模型。它不再满足于让AI“会说”,而是要让AI真正“理解”物理世界——在行动之前先在脑海里推演一遍“我这么做,是否符合这个世界的物理规律”。
本文将从世界模型的技术突破和模型架构的范式转移两个维度,盘点2026年大模型领域最值得关注的技术变革。
一、世界模型:从“生成内容”到“理解物理世界”
1.1 什么是世界模型?
如果用一句话概括:世界模型让机器像人一样,在行动之前先在脑海里推演一遍世界的演化。
智源研究院院长王仲远将其定义为“下一代AI基座模型”,核心是物理状态预测——让AI理解并交互真实物理世界。现有技术可分为语言中心型、像素中心型、三维结构中心型等四类。
过去两年AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。而从2026年开始,核心命题正转向 “理解”与“交互” ——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。
1.2 智源悟界·RoboBrain Orca:给AI搭建“脑海世界”
7月初,北京智源人工智能研究院发布的全新多模态表征世界模型智源悟界·RoboBrain Orca,率先实现了对整体世界状态的前后演化推演。
核心创新在于构建统一的世界潜在表征空间——相当于为AI搭建起虚拟的“脑海世界”。输入视频、图片、文字指令等任意多模态信息后,模型可将视觉、语言、任务意图等多元信号统一整合,自主学习物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。它既能推演当前场景走向未来的演化路径,也能模拟不同条件下世界发展的多元可能性,完成从 “单一输出预测”到“全局状态推演” 的范式升级。
在训练方法上,研发团队设计了有意识、无意识双路径互补训练体系:
-
无意识学习:依托海量真实世界视频素材,复刻人类婴幼儿观察自然积累常识的过程,无标注自主感知物体掉落、物体移动、空间交互等客观规律
-
有意识学习:依托文字事件、任务指令、视觉问答等标注数据,针对性学习具备明确语义的状态转换逻辑
模型累计使用12.5万小时真实视频素材、1.6亿条事件标注数据。依托训练形成的统一世界表征,模型可适配文本、图像、机器人动作等多类解码器完成信息输出。
1.3 大晓开悟Kairos 3.1:125毫秒推理延迟,52倍效率提升
7月19日,大晓机器人在WAIC 2026上正式发布开悟世界模型3.1(Kairos 3.1) ,并面向各行业开源。这是全球首个端侧驱动本体的“行动一体化世界模型” 。
Kairos 3.1最核心的技术突破在于原生统一架构——将世界理解、物理生成、动作预测三大核心能力深度融合于同一技术底座,构建出 “理解—推演—执行—反思”全链路自进化智能闭环 。
具体而言:
-
空间理解:依托混合Transformer架构与共享混合注意力机制,将视觉观测、语言指令、力触状态、策略轨迹等多维具身数据统一编码至同一隐空间。其空间理解底座已累计获得十二项全球基准测试SOTA
-
物理生成:模型内置30万套中国真实住宅平面图、5000个全屋仿真场景及8700个高质量3D资产
-
动作预测:可在平行空间内同步开展多策略演算,筛选最优策略输出
-
自主反思闭环:在执行失败时自主定位问题并迭代优化策略——以开冰箱取水任务为例,机器人从三指操作失败后自主切换为四指方案完成开门
性能数据令人震撼:在NVIDIA Jetson Thor平台、BF16精度下,Kairos 3.1 8B模型平均推理延迟仅125毫秒,较同类型世界模型Cosmos 3 Nano(6486毫秒)提升52倍。该模型已在世界模型视频生成和状态预测的权威评测中超越Cosmos 3、PI、MotuBrain等主流模型,位居第一。
Kairos 3.1的发布不仅是具身世界模型的技术里程碑,更为具身智能走向家庭、工业等真实规模化场景提供了可落地的完整技术路径。
1.4 昆仑万维Matrix-Game 3.5:可交互世界模型
昆仑万维在WAIC期间正式发布了Matrix-Game 3.5世界模型。该模型聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化。5B模型在720p分辨率下可实现单卡20FPS实时生成,具备1分钟记忆能力。
昆仑万维董事长兼CEO方汉指出,具身智能正从实验室走向真实环境,这一趋势要求机器人在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。他还预判,游戏行业将率先被世界模型改变——开放世界游戏不再依赖数百人团队数年的手工搭建,未来三到五年世界模型将成为游戏行业的基础设施。
1.5 北京大学EvoPhys-World:首个全球5D世界模型
北京大学EvoPhys团队在摩尔线程国产千卡集群上完成了全球首个5D世界模型EvoPhys-World的全栈原生训练。这标志着中国不仅在模型层面,在底层训练基础设施层面也已具备支撑前沿世界模型研发的能力。
1.6 世界模型的产业化趋势
世界模型正在从学术概念走向产业实践。2026年被视为具身智能部署元年,在WAIC现场,具身智能企业不再像此前展现机器人的“舞蹈功底”,转而将真实产线搬到展台。
王仲远判断,未来三到五年将是世界模型持续迭代期。行业企业正逐渐把世界模型融入具身模型中,成为今年技术进展的一大推动力。
二、架构范式转移:谁在挑战Transformer的王座?
当世界模型在应用层面开疆拓土时,模型架构层面的变革同样激烈。2017年谷歌那篇《Attention is All You Need》奠定了Transformer九年的统治地位。但2026年,多个方向的替代方案正在同时涌现。
2.1 SSA架构:13人团队,算力暴减千倍
5月,一家名为Subquadratic的迈阿密初创公司——全公司仅13人——发布了基于SSA(亚二次方稀疏注意力)架构的模型SubQ,上下文高达1200万Token。
SSA的核心思路极其简单:既然训练好的模型中绝大多数注意力权重都接近零,为什么还要算它们? 它不再让每个token和所有token做比较,而是对每一个query基于 “内容” 选择序列中真正值得关注的位置,只在这些位置上精确计算注意力,跳过其余99%以上的无用计算。
三大关键特性:
-
线性扩展:计算量随选中的位置数量增长,而非随整个序列长度增长。上下文翻倍,成本只翻倍,不再是翻四倍
-
内容依赖路由:模型根据语义决定看哪里,而不是根据位置
-
精确检索:不像循环模型那样把信息压缩成固定状态,SSA保留了从任意位置精确取回信息的能力
实验数据令人震撼:在100万token上下文下,SSA比标准密集注意力+FlashAttention-2快52.2倍。在1200万token下,注意力FLOP减少了接近1000倍。成本方面,在RULER 128K基准测试上,SubQ花费8美元,Opus为2600美元——300倍的成本差距。
AI大佬Bindu Reddy评价道:“若这一切都是真的,Anthropic和OpenAI的估值直接归0。”
2.2 CoFrGeNets:用连分数重构Transformer
IBM Research在ICML 2026上提出了一个更具颠覆性的方向——CoFrGeNets(连分数生成网络) 。
该架构以连分数这一数学表示方法为核心,取代了Transformer中的多头注意力机制和前馈网络。连分数通过嵌套的除法序列来表达一个值,能够以紧凑的方式捕捉复杂的数学关系。多个“梯级”集合在一起,能够用远少于传统神经网络的参数量来近似非常复杂的函数。
实验结果令人瞩目:在下游分类任务中,CoFrGeNet变体(尤其是CoFrGeNet-F)在参数量远少于对手(通常少数亿个参数)的情况下,性能与GPT2-xl持平甚至略胜一筹。即便在更大规模的Llama-3.2B实验中,CoFrGeNet在开放域问答和推理等任务上依然保持竞争力,同时体量更小、训练更快。
当然,连分数在GPU上存在计算成本高和数值不稳定的挑战——例如分母出现极小值时结果可能趋近于无穷大。研究团队采用了一种名为“clamping”的技术来保证数值稳定性。
2.3 循环架构:让模型“循环思考”
学术界与工业界的目光正在从无休止的“堆料”,转向一种古老而又崭新的范式——循环架构(Recurrent Architectures / Looped Transformers) 。
其核心思想是将 “静态层堆叠”转化为“动态循环迭代” 。计算深度不再是静态的模型超参数,而是运行时的动态旋钮。这意味着模型可以在推理时根据需要“循环”更多次,用更少的参数量实现更深层次的思考。
Attractor Models的研究显示,循环架构在语言建模上相比标准Transformer实现了困惑度最高降低46.6% ,下游准确率最高提升19.7% ,同时降低了训练成本。
2.4 扩散语言模型:第三条路
ICML 2026的获奖名单释放了一个清晰信号:扩散模型是当下研究密度最高的地带,下一代语言模型架构之争中扩散模型已正式入局。
与GPT、Claude这类自回归模型从左到右逐个token生成不同,扩散语言模型像画画一样从噪声中逐步“去噪”出完整文本。理论上这种架构有个巨大优势——可以灵活调整文本生成与润色的先后顺序。
英伟达开源的TwoTower模型进一步推动了这一方向,将扩散语言模型中的上下文表示与去噪过程分离到两个独立的神经网络“塔”中,保留98.7%质量的同时,AI生成提速2.42倍。
不过,清华大学黄高团队在ICML 2026杰出论文中指出,扩散语言模型“任意顺序生成”的核心卖点存在根本性缺陷——“看似灵活的随机解码实则陷入‘灵活性陷阱’,因‘先易后难’跳过关键token而收窄推理边界”。
写在最后
2026年的大模型技术图景,正在经历双重变革。
在应用层面,世界模型正在崛起。智源悟界·RoboBrain Orca实现了全局状态推演,大晓Kairos 3.1以125毫秒延迟和52倍效率提升证明了世界模型可以落地,昆仑万维Matrix-Game 3.5让可交互世界模型成为现实。AI正在从“生成内容”走向“理解物理世界” 。
在架构层面,Transformer的王座正受到前所未有的挑战。SSA架构用线性扩展替代平方复杂度,CoFrGeNets用连分数重构Transformer的核心组件,循环架构让模型“循环思考”,扩散语言模型开辟了“去噪生成”的第三条路。参数规模不再是唯一叙事——架构创新正在重新定义效率的边界。
正如行业观察者所言,AI架构已不再仅由模型规模来定义。生产系统正越来越多地结合条件计算、检索、记忆、工具、验证器、端云路由、可观测性和治理。
九年前Transformer横空出世时,没有人能预料到它统治AI行业如此之久。2026年,我们或许正在见证下一个九年的起点。
更多推荐
所有评论(0)