2026大模型技术全景:架构创新、持续学习与科学发现的革命
引言
2026年7月,大模型行业进入了一个前所未有的密集创新期。从蚂蚁百灵到腾讯混元,从心洲科技到中科院,一系列技术突破在短短一个月内密集落地,宣告行业正式告别“唯参数论”的单一叙事。
与此同时,ICML 2026和ACL 2026两大顶级学术会议相继召开,扩散模型、连分数架构、强化学习等方向的研究成果揭示了下一代AI的技术方向。
2026年7月的大模型技术图景,可以用一句话概括:从“更大”到“更聪明”,从“通用”到“专业”,从“烧钱”到“高效”。
本文将从模型架构创新、持续学习范式、推理效率革命、科学发现赋能、算力基础设施五个维度,系统盘点2026年7月大模型领域最值得关注的技术进展。
一、架构创新:告别“无脑Full Attention”
1.1 HiLS-Attention:稀疏注意力首次被“做对”
让大模型“读得更长”是Agent、深度推理和海量资料整合的刚需。但标准全注意力面临三重困境:计算量平方级增长、长度外推差、KV Cache随序列线性膨胀。
2026年7月20日,腾讯混元团队正式开源HiLS-Attention(分层地标稀疏注意力) ,提出了一种全新的分块稀疏注意力范式。该方法首次在数学层面上同时解决了chunk重要性估计的“表达力不足”和选择过程的“端到端不可导”两大根本难题。
腾讯混元团队发现,现有方法(如NSA、InfLLM v2、MoBA等)普遍使用均值池化或最大logits来估计chunk重要性,但均值只在注意力均匀分布时才准,最大值只在单token独占注意力时才准。真实场景中logit分布随query、head和数据剧烈变化,导致系统性地错估chunk重要性。
HiLS-Attention的核心创新分为两步。第一步,利用一阶泰勒展开构造chunk重要性估计函数,通过引入“熵偏置”项,在任意logit分布下都能自适应地贴合真实重要性。第二步,将注意力权重分层因式分解为两级softmax——chunk间softmax决定每个chunk整体能分到多少注意力,chunk内softmax决定token间的相对权重。关键突破在于,LM loss的梯度可以一路反传到summary key和地标token——chunk选择首次成为端到端可学习的过程。
实验数据令人震撼:在345M到7B三个参数规模上,HiLS-Attention在短文本场景下语言建模困惑度与全注意力几乎重合;仅用8K训练即可实现4M上下文(512倍)的免训外推,大海捞针准确率仍保持90%以上;512K上下文下prefill快13.5倍、单步decode快15.7倍。
更反直觉的是,HiLS在部分长上下文检索任务上反超了全注意力本身——变量追踪等多跳任务上比全注意力高出多达50%。研究团队解释,这可能是因为压缩本身具有去噪效果。
1.2 LongCat-2.0:五万卡国产算力集群上的万亿模型
7月6日,美团正式开源万亿参数大模型LongCat-2.0,总参数达1.6万亿,平均激活约48B,专为Agentic Coding任务设计。架构上创新性引入LongCat稀疏注意力机制(LSA)和N-gram Embedding,前者通过流感知索引、跨层索引等策略提升百万级长上下文的训练与推理效率,后者以135B参数投入新模块,在MoE稀疏度接近97%的背景下进一步强化代码理解与生成能力。
更值得关注的是,LongCat-2.0是业界首个在五万卡国产算力集群上完成推理的万亿参数模型。团队从模型架构、芯片适配到部署策略进行深度协同优化:通过Super Kernel减少算子启动开销、Weight Prefetch隐藏I/O延迟,并采用PD分离部署与KV-cache切分。美团同步开源BF16、FP8及INT8等多精度版本,覆盖不同算力平台部署需求。
1.3 Ling-3.0-flash:124B参数,5.1B激活,越级挑战
7月24日,蚂蚁百灵正式发布新一代原生混合推理模型Ling-3.0-flash。相比上一代1T级旗舰思考模型Ring-2.6-1T,Ling-3.0-flash的总参数量为124B(约为前者的12.4%),激活参数量仅为5.1B(约为前者的8.1%),却实现了全方位的能力对标甚至超越。
实现“小体量、高智能”的关键,源于模型底层计算架构的重新设计。Ling-3.0-flash从预训练阶段即采用混合注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层,让模型在长上下文效率与模型能力之间实现更优平衡。此外,每个Token的专家激活比例由前代的1/32进一步压缩至1/64。
针对Agent场景,Ling-3.0-flash扩展了超10000个真实交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。在响应速度上,通过引入集群级分级缓存,将长输入下的首字响应延迟降低了60%至80%以上。该模型已上线OpenRouter限时免费一周,之后将正式开源。
1.4 CoFrGeNets:用连分数重构Transformer
IBM Research在ICML 2026上提出了CoFrGeNets(连分数生成网络) ,这是一种全新的模型架构,以连分数这一数学表示方法为核心,取代了Transformer中的多头注意力机制和前馈网络。
连分数通过嵌套的除法序列来表达一个值,能够以紧凑的方式捕捉复杂的数学关系。多个“梯级”集合在一起,能够用远少于传统神经网络的参数量来近似非常复杂的函数。
实验结果令人瞩目:在下游分类任务中,CoFrGeNet变体在参数量远少于对手(通常少数亿个参数)的情况下,性能与GPT2-xl持平甚至略胜一筹。即便在更大规模的Llama-3.2B实验中,CoFrGeNet在开放域问答和推理等任务上依然保持竞争力,同时体量更小、训练更快。
二、持续学习:模型在部署之后继续成长
2.1 Macaron-V1:挑战Scaling Law的新范式
7月21日,心洲科技旗下Mind Lab正式开源旗舰模型Macaron-V1,在智谱GLM-5.2的千亿参数基座之上,通过LoRA插件式架构实现了模型的 “持续学习”与“群体智能” 。
当今大模型的能力基本都是在少数几次集中训练中获得的,训练结束后参数冻结,以固定状态进入部署。然而许多有价值的信息——用户的长期偏好、代码库的独特架构、任务反复失败的原因——都是部署之后才会涌现的。Mind Lab提出的 “经验智能机器” 概念的核心理念是:机器应从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题。
Macaron-V1的核心是Mixture-of-LoRA(MoL)架构。旗舰版Venti(748B总参数)在冻结的GLM-5.2(744B)基座上搭载了四个1B的LoRA专家:L0 Chat(对话)、L1 Agent(工具使用)、L2 Coding(代码理解)、L3 GenUI(UI生成)。新能力以插件式LoRA加入,不动摇已有知识。
这一做法挑战了行业长期以来的Scaling Law信仰。在UI4A等基准测试中,Macaron-V1成绩全面超越基座GLM-5.2,甚至大幅领先Claude Opus 4.8。
更令人震撼的是群体智能实验:从相同的Qwen3-30B基础模型出发,只改变数据顺序。在AIME24上,单个adapter准确率是36.44%;把198个不同adapter做多数投票,准确率提高到48.67%;而同一adapter重复采样最高只到43.78%。这说明不同学习轨迹带来的差异包含了超出普通采样的互补性——群体不是简单的重复,而是真的更聪明。
2.2 单层RL超越全参数训练
来自明尼苏达大学、北京大学和亚马逊的团队在ICML 2026上发表的论文挑战了一个长期假设:RL后训练的收益是否均匀分布在所有Transformer层?
通过对7个模型、跨越2个模型家族、3种RL算法、3个任务领域的系统性逐层研究,发现RL收益高度集中在一小部分中间层,而非均匀分布。更令人惊讶的是,训练单个Transformer层即可匹敌甚至超越全参数RL训练。
这一发现为RL后训练提供了全新的优化思路——不再需要更新全部参数,只需精准更新关键层,即可用更少的计算成本获得同等甚至更好的效果。
三、推理效率革命:从“烧钱”到“精打细算”
3.1 MiniMax MSA:百万token成本降至1/20
在WAIC 2026前夕,MiniMax披露了其自研稀疏注意力(MSA)架构的最新进展。传统算法计算量随序列长度呈平方级增长,处理长文本或高清视频时成本极高。MSA的思路类似于 “精准派单” ——不再激活全部模型,而是只调动最相关的几个专家模块。
通过MSA架构,MiniMax成功将百万字长文本的单位Token计算成本降至传统全注意力机制的约1/20。该架构已在MiniMax新一代文本模型M3上落地,在同样的计算资源下可以处理更长的上下文,推理速度也更快。
3.2 QLPO:隐式长度控制,不碰奖励函数
7月23日,arXiv上发表的QLPO(Quadrant-weighted sampling for Length-aware Policy Optimization)提出了一种基于重采样的GRPO变体。QLPO首先过生成候选响应,然后通过保持经验正确/错误比例的同时,偏向短的正确响应和长的错误响应来重新采样训练组。
这一方法引入了隐式长度控制,无需修改奖励函数,简单而有效。
四、科学发现:大模型正在“搞科研”
4.1 磐石·科学基础大模型2.0
7月17日,中国科学院正式发布磐石·科学基础大模型2.0。该模型采用 “通专一体”技术路径,打破通用人工智能与各领域专业科学能力融合的壁垒。
模型采用递进的三层架构,构建起“科学数据统一编码—自然世界知识对齐—领域任务定向解码”的完整科学智能链路,一个模型即可高效完成跨学科深度数据理解、可靠知识推理、精准科学预测、专业科研内容生成等多种任务。
在数据支撑层面,中国科学院科技语料库联合各领域多个研究所共同构建了800万条高质量科学推理数据,覆盖200多个科研任务。在60余项专业科研任务评测中,磐石2.0在绝大多数任务上均显著超越通用旗舰模型,并在化学性质预测、谱到分子结构预测、蛋白质位点预测等任务上领先领域专用模型。
以磐石2.0为核心的一体化智能科研平台也已建成,汇聚海量优质科学数据集、8000余个专业科研工具和技能库。算力配套方面,构建了 “超算+智算+速算”三位一体的异构算力体系,已适配昇腾与海光等国产芯片。磐石目前已落地50余家中国科学院内研究所,30余家院外高校、科研单位和央国企。
4.2 ICML 2026:扩散模型的“灵活性陷阱”
7月5日,阿里巴巴与清华大学合作的论文《The Flexibility Trap》入选ICML 2026杰出论文。该论文对扩散语言模型(dLLM)的“任意顺序生成”这一核心卖点提出了根本性质疑。
研究发现,不确定性高的关键逻辑节点(如“因此”“所以”)像是一个分叉口。若采用从左向右的顺序,模型必须在此处当场作出选择。若采用任意选择生成顺序,模型会倾向于绕过这些难点,优先处理容易的部分。等回头再填充这些节点时,前后文已经确立,原本的推理分叉口变成了填空题——答案被上下文锁定了。
实证数据证实:在HumanEval代码生成任务上,从左往右顺序能解出、而任意顺序解不出的题目占21.3%,反向仅0.6%。顺序的自由度越大,推理性能越差。
基于这一发现,团队提出的解决方案是 “JustGRPO” ——在强化学习训练阶段放弃任意顺序,强制模型从左到右生成。训练完成后,在GSM8K上达到89.1%准确率,全面超越所有为扩散模型专门设计的复杂强化学习算法。
五、算力基础设施:从“千卡”到“10万卡”
5.1 曙光8000:首个全国产10万卡超集群
7月,我国首个全国产10万卡人工智能超集群——曙光8000正式落成投用。这标志着我国算力基础设施建设正式迈入10万卡级部署阶段。
曙光8000采用 “超智融合”技术路线,将高精度科学计算与低精度智能计算能力统一到同一系统中。一个芯片既需要具备对科学工程计算、数字计算仿真的支撑能力,也需要具备对神经网络类算法的支撑能力。系统覆盖双精度64位到32位、16位、8位甚至更低精度,可满足科学计算、大模型训练、人工智能推理、工业仿真等计算需求。
这是一个名副其实的 “超级工程” :30亿颗电子元器件实现精密协同,互联线缆总长超1600公里,系统总重1500吨——全部被压缩在不足0.05毫米的结构组装精度之内。系统从芯片、计算、存储、网络、散热到应用、服务,实现全链路全自研全国产化。
曙光8000投用首周已实现满载运行,日均处理作业数突破15万个,单日处理作业峰值超过50万个。在WAIC 2026上,曙光8000被列入十大 “镇馆之宝” 。
5.2 花旗报告:瓶颈从“算得快”转向“搬得动”
花旗在7月24日发布的最新报告中指出,万亿参数模型正在改写“算力”的含义。这些超大模型实际运行时,越来越多的时间花在跨HBM内存和GPU互联网络搬运权重及KV-cache数据上,而非矩阵运算本身。瓶颈已经从 “算得快不快”(FLOPs)转向了“搬得动搬不动”——内存带宽、GPU互联和电力供应。
部分实验室开始直接切入上游发电:SpaceX斥资10亿美元购买1GW移动涡轮机组。AI实验室买发电设备——一年前几乎不可想象的事情,现在正在发生。
花旗判断,下一阶段的模型竞争护城河,将从单纯的 “算力获取”彻底转向“高效产出与专有数据” 。
写在最后
2026年7月的大模型技术图景,可以用几个关键词概括:
架构上,HiLS-Attention在数学上把稀疏注意力“做对”,CoFrGeNets用连分数重构Transformer的根基,Ling-3.0-flash用5.1B激活参数越级挑战——不再盲目堆参数,而是让每一份算力都用在刀刃上。
范式上,Macaron-V1用持续学习挑战Scaling Law,单层RL超越全参数训练——模型可以在部署之后继续成长,不需要每次都从头开始。
效率上,MiniMax MSA将长文本成本砍至1/20,QLPO实现隐式长度控制——推理成本正在从“烧钱”走向“精打细算”。
应用上,磐石2.0正在“搞科研”,扩散模型的“灵活性陷阱”被揭示——大模型正在从“通用聊天”走向“专业赋能”。
基础设施上,曙光8000的10万卡全国产超集群落成——算力竞争已从芯片性能比拼升级为全栈系统能力的较量。
当模型能力趋于收敛,谁能把架构设计得更聪明、让模型持续学习、把推理成本降到最低、让AI真正赋能专业领域,谁就能赢得下一阶段的竞争。这不是参数的战争,这是效率与智能的战争。
更多推荐

所有评论(0)