只激活 3B,性能却反超?阿里 Qwen3-Next 背后的技术黑魔法
阿里又发布了一个 80B 模型,但只激活 3B?
大模型越来越卷了。确切地说,是 MoE 大模型。
9 月 12 日凌晨,阿里 Qwen 团队官宣发布 Qwen3-Next-80B-A3B 模型。

顾名思义,Qwen3-Next-80B-A3B 是基于 Qwen3-Next 技术架构,总参数为 80B(800 亿),推理时仅激活 3B(30 亿)参数的 MoE 模型。
就是这个只激活了 30 亿参数的“小”模型,基础性能却逼近了 Qwen3-235B-A22B,推理上更是超过了 320 亿的 Qwen3-32B-Thinking,而训练成本连 Qwen3-32B 的十分之一都不到。
用阿里官方的话说就是:
更极致的训练和推理性价比。
01|为什么 80B 模型只激活 3B?
这是 MoE 的核心逻辑。
MoE 是 Mixture of Experts 的缩写,也就是混合专家的意思。
传统大模型,每个 token 都要激活全部层级参数,算力爆表。
而 MoE 则是把每层拆成多个专家(Experts),每次只激活其中一小部分。
阿里的这个 Qwen3-Next-80B-A3B,更是被称为极致稀疏的 MoE:512 个专家,只激活 10 个路由专家和 1 个共享专家。
这样一来:
- 总模型容量很大(多个专家);
- 实际推理成本很低(每个 token 只激活小部分专家)。
结果就是,模型在训练时保留了“多、广、深”的优势,但在实际推理时“又快又省”。
02|什么是混合注意力机制?
Qwen3-Next-80B-A3B 模型背后的技术意义,甚至要大于这个模型本身。
传统 Transformer 架构的注意力(Attention)是平方复杂度(O(n^2)),序列长度翻倍,计算量翻 4 倍,长文本直接爆炸。
这就是为什么各大 AI 厂商死抠“上下文长度”的原因。
比如,都 2025 年了,ChatGPT Plus 用户在非推理场景下,最大上下文也还卡在 32K。

Qwen3-Next 则提出了一个新思路:混合注意力机制。
- 75% 用 Gated DeltaNet(高效的线性注意力);
- 25% 用 Gated Attention(传统的标准注意力)。
其中,Gated DeltaNet 本质上更像是 RNN(Recurrent Neural Network,循环神经网络)。
它不依赖传统的 KV Cache,也不随序列长度线性增长,而是用一个固定大小的状态矩阵,在 O(1) 时间内直接生成下一个 token。
这种机制就像生活中的交通道路组合:大部分走高速(DeltaNet)快速通过,关键路口走普通道路(标准注意力)精准导航。

这种架构创新,恐怕才是 Qwen3-Next 名字里真正的“Next”。
03|黑科技:多 Token 预测
传统大模型,每次只预测下一个 token。
阿里这次在 Qwen3-Next-80B-A3B 模型中加入了 MTP(Multi-Token Prediction,多 Token 预测)机制。
讲人话:一次预测多个后续 token,提高生成吞吐量。
对用户来说,这意味着更流畅的文本生成、更少的卡顿、以及更高效的多轮推理效率。
04|Qwen3-Next-80B-A3B 表现怎么样?
Qwen3-Next-80B-A3B 提供两个版本:
- Instruct 版本:不思考,快速响应
- Thinking 版本:推理模型
先来看来自阿里官方的基准测试结果对比。
红色是 Qwen3-Next-80B-A3B-Instruct,应该说和 Qwen3-235B-A22B 旗鼓相当,甚至有超越。

而自带推理的 Qwen3-Next-80B-A3B-Thinking 则更猛,直接碾压了 Gemini-2.5-Flash Thinking。
多说一句,毕竟参数量就这么大,要让它和真正的顶级模型比,还是不现实的。

再来看 Artificial Analysis 排行榜。
最新的榜单里,Qwen3-Next-80B-A3B-Thinking 赫然已经超越了 DeepSeek-R1 0528,并且和 DeepSeek-V3.1 Thinking 同分。
当然,没有完全客观的排行榜,看看就好。最终还是要以实际体验为准。

05|Qwen3-Next-80B-A3B 怎么用?
附上 Qwen3-Next-80B-A3B 的使用链接。
- 在线使用(免费):https://chat.qwen.ai
- Huggingface:https://huggingface.co/collections/Qwen/qwen3-next-68c25fd6838e585db8eeea9d
- ModelScope:https://modelscope.cn/collections/Qwen3-Next-c314f23bd0264a
- Kaggle:https://www.kaggle.com/models/qwen-lm/qwen3-next-80b
结语
Qwen3-Next-80B-A3B,本质是架构创新的胜利。
80B VS 3B,混合注意力机制,多 Token 预测,这些技术创新都指向同一个方向:用更聪明的方式,而不是更大的参数,来提升模型性能。
这可能才是大模型“内卷”的正确方向。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2025 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:
三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】
四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2025 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐



所有评论(0)