从大模型到稀疏模型:MoE为什么成为超大模型主流架构
过去几年,大模型有一个非常直接的发展逻辑:
参数越多,模型能力越强。
但参数越多,也意味着训练和推理成本不断增加。
如果一个模型有数千亿甚至上万亿参数,每生成一个 Token 都把所有参数计算一遍,成本会非常高。
于是,越来越多超大模型开始采用一种新的思路:
Mixture of Experts,简称 MoE。
2026 年发布的 NVIDIA Nemotron 3 Ultra 就采用了 MoE 架构:模型拥有 550B 总参数,但每次只激活约 55B 参数。
这句话基本解释了 MoE 的核心:
模型可以拥有非常大的“知识容量”,但每次只调用其中一部分。
一、MoE 到底是什么?
传统 Dense Model,也就是稠密模型,可以简单理解为:
输入 Token
↓
所有 Transformer 参数
↓
输出
每次推理,大量参数都会参与计算。
而 MoE 会在 Transformer 中加入多个“专家网络”。
输入 Token
↓
Router
↓
多个 Expert
↓
只激活其中少数专家
↓
输出
Router 会根据 Token 的特征,选择更合适的专家处理。
因此:
总参数可以很大,但实际参与一次计算的参数只占一部分。
二、为什么模型厂商越来越喜欢 MoE?
MoE 最大的吸引力在于:
把“模型容量”和“单次计算量”部分解耦。
例如一个 500B 参数的 MoE 模型,实际每个 Token 可能只激活几十 B 参数。
这样理论上就能获得:
- 更大的模型容量;
- 更低的单 Token 计算量;
- 更好的训练扩展性;
- 更灵活的专家分工。
可以把它想象成一家大型医院。
Dense Model 相当于:
每来一个患者,全院医生都参与会诊。
MoE 相当于:
先分诊,再让最合适的几个专家处理。
医院可以拥有很多医生,但每个病例不需要所有人同时工作。
三、但“只激活少量参数”不等于“部署很便宜”
这里有一个很容易被忽略的问题。
很多人看到:
550B 总参数,55B 激活参数。
就会认为:
那它的部署成本应该和 55B Dense Model 差不多。
实际上并不是。
因为即使某一次计算只激活部分专家,大部分专家权重仍然要存在某个地方。
这意味着 MoE 依然可能需要非常大的:
- GPU HBM;
- CPU 内存;
- 多卡显存;
- 存储空间。
NVIDIA 在 2026 年发布的 LatentMoE 研究中就特别强调:
Sparsity ≠ cheap inference。
也就是说:
稀疏计算,不代表推理一定便宜。
四、MoE 真正的瓶颈为什么变成“搬数据”?
假设一个模型有 128 个 Expert。
这些 Expert 不可能全部放在一张 GPU 中。
通常需要把它们分布到不同 GPU:
GPU 1:部分 Expert
GPU 2:部分 Expert
GPU 3:部分 Expert
……
当 Router 决定某个 Token 应该去某个 Expert 时,这个 Token 就需要被发送到对应 GPU。
计算完成以后,结果还需要再传回来。
这会产生大量:
All-to-All Communication。
于是 MoE 出现了一个很特别的现象:
单个 Token 计算量减少了,但 GPU 之间的数据移动变多了。
因此 MoE 性能非常依赖:
- NVLink;
- InfiniBand;
- 高速 Ethernet;
- Expert Parallel;
- Token Dispatch;
- 网络拓扑。
这也是为什么 MoE 大模型通常更适合高带宽 GPU 集群,而不是简单地堆几张显卡。
五、为什么 HBM 容量对 MoE 特别重要?
MoE 还有一个问题:
Expert 权重非常多。
如果所有 Expert 都能留在 GPU HBM 中,访问速度会很快。
但显存不足时,就需要:
GPU HBM
↕
CPU RAM
不断加载 Expert。
这时候模型可能出现一种情况:
GPU 算得很快,但一直在等待 Expert 权重搬过来。
所以 MoE 推理经常受到:
Memory Bandwidth 和 Memory Capacity
的限制。
这也是为什么近几代 AI GPU 不仅在增加 FLOPS,也在不断提高 HBM 容量和带宽。
六、Expert Parallel 为什么越来越重要?
为了让 MoE 在多 GPU 上运行,需要一种专门的并行方式:
Expert Parallelism,专家并行。
它和普通 Tensor Parallel 不同。
Tensor Parallel 是:
把同一个矩阵拆到多张 GPU。
Expert Parallel 则是:
把不同 Expert 放到不同 GPU。
例如:
GPU 0 → Expert 0、1
GPU 1 → Expert 2、3
GPU 2 → Expert 4、5
GPU 3 → Expert 6、7
Router 决定 Token 应该去哪张 GPU。
因此 Expert Parallel 的核心问题不是“怎么算矩阵”,而是:
怎样把 Token 快速送到正确的 Expert。
这进一步提高了网络在 AI 集群中的重要性。
七、MoE 对云 GPU 平台意味着什么?
对于普通用户来说,Dense Model 的资源估算相对直观:
参数量 → 显存 → GPU 数量。
但 MoE 更复杂。
选算力时至少要同时看:
- 总参数量;
- 激活参数量;
- Expert 数量;
- 每 Token 激活几个 Expert;
- 模型精度;
- GPU HBM;
- GPU 间带宽;
- 推理框架是否支持 Expert Parallel。
因此以后看到一个 MoE 模型时,不能只问:
“它每次激活多少 B?”
更应该问:
整个模型到底多大,Expert 在哪里,Token 怎么在 GPU 之间移动?
这才是真正决定部署效率的问题。
八、结语:MoE 的本质,是“用网络换计算”
MoE 提供了一条非常重要的大模型扩展路径:
让模型拥有更多参数,但每次只计算其中一部分。
它降低了纯计算压力。
但同时带来了新的成本:
- 更大的模型权重;
- 更多 HBM;
- 更复杂的 Expert 调度;
- 更多 GPU 间通信。
因此可以用一句话总结:
Dense Model 更依赖算力,MoE Model 更考验“算力 + 内存 + 网络”的协同。
未来大模型继续增长时,MoE 很可能仍然会是重要架构。
但真正决定 MoE 能否低成本运行的,并不只是“稀疏”两个字。
而是:
能不能让数百个 Expert 在整个 GPU 集群中被快速、稳定地调用。
更多推荐

所有评论(0)