过去几年,大模型有一个非常直接的发展逻辑:

参数越多,模型能力越强。

但参数越多,也意味着训练和推理成本不断增加。

如果一个模型有数千亿甚至上万亿参数,每生成一个 Token 都把所有参数计算一遍,成本会非常高。

于是,越来越多超大模型开始采用一种新的思路:

Mixture of Experts,简称 MoE。

2026 年发布的 NVIDIA Nemotron 3 Ultra 就采用了 MoE 架构:模型拥有 550B 总参数,但每次只激活约 55B 参数。

这句话基本解释了 MoE 的核心:

模型可以拥有非常大的“知识容量”,但每次只调用其中一部分。


一、MoE 到底是什么?

传统 Dense Model,也就是稠密模型,可以简单理解为:

输入 Token
   ↓
所有 Transformer 参数
   ↓
输出

每次推理,大量参数都会参与计算。

而 MoE 会在 Transformer 中加入多个“专家网络”。

输入 Token
   ↓
Router
   ↓
多个 Expert
   ↓
只激活其中少数专家
   ↓
输出

Router 会根据 Token 的特征,选择更合适的专家处理。

因此:

总参数可以很大,但实际参与一次计算的参数只占一部分。


二、为什么模型厂商越来越喜欢 MoE?

MoE 最大的吸引力在于:

把“模型容量”和“单次计算量”部分解耦。

例如一个 500B 参数的 MoE 模型,实际每个 Token 可能只激活几十 B 参数。

这样理论上就能获得:

  • 更大的模型容量;
  • 更低的单 Token 计算量;
  • 更好的训练扩展性;
  • 更灵活的专家分工。

可以把它想象成一家大型医院。

Dense Model 相当于:

每来一个患者,全院医生都参与会诊。

MoE 相当于:

先分诊,再让最合适的几个专家处理。

医院可以拥有很多医生,但每个病例不需要所有人同时工作。


三、但“只激活少量参数”不等于“部署很便宜”

这里有一个很容易被忽略的问题。

很多人看到:

550B 总参数,55B 激活参数。

就会认为:

那它的部署成本应该和 55B Dense Model 差不多。

实际上并不是。

因为即使某一次计算只激活部分专家,大部分专家权重仍然要存在某个地方。

这意味着 MoE 依然可能需要非常大的:

  • GPU HBM;
  • CPU 内存;
  • 多卡显存;
  • 存储空间。

NVIDIA 在 2026 年发布的 LatentMoE 研究中就特别强调:

Sparsity ≠ cheap inference。

也就是说:

稀疏计算,不代表推理一定便宜。


四、MoE 真正的瓶颈为什么变成“搬数据”?

假设一个模型有 128 个 Expert。

这些 Expert 不可能全部放在一张 GPU 中。

通常需要把它们分布到不同 GPU:

GPU 1:部分 Expert
GPU 2:部分 Expert
GPU 3:部分 Expert
……

当 Router 决定某个 Token 应该去某个 Expert 时,这个 Token 就需要被发送到对应 GPU。

计算完成以后,结果还需要再传回来。

这会产生大量:

All-to-All Communication。

于是 MoE 出现了一个很特别的现象:

单个 Token 计算量减少了,但 GPU 之间的数据移动变多了。

因此 MoE 性能非常依赖:

  • NVLink;
  • InfiniBand;
  • 高速 Ethernet;
  • Expert Parallel;
  • Token Dispatch;
  • 网络拓扑。

这也是为什么 MoE 大模型通常更适合高带宽 GPU 集群,而不是简单地堆几张显卡。


五、为什么 HBM 容量对 MoE 特别重要?

MoE 还有一个问题:

Expert 权重非常多。

如果所有 Expert 都能留在 GPU HBM 中,访问速度会很快。

但显存不足时,就需要:

GPU HBM
   ↕
CPU RAM

不断加载 Expert。

这时候模型可能出现一种情况:

GPU 算得很快,但一直在等待 Expert 权重搬过来。

所以 MoE 推理经常受到:

Memory Bandwidth 和 Memory Capacity

的限制。

这也是为什么近几代 AI GPU 不仅在增加 FLOPS,也在不断提高 HBM 容量和带宽。


六、Expert Parallel 为什么越来越重要?

为了让 MoE 在多 GPU 上运行,需要一种专门的并行方式:

Expert Parallelism,专家并行。

它和普通 Tensor Parallel 不同。

Tensor Parallel 是:

把同一个矩阵拆到多张 GPU。

Expert Parallel 则是:

把不同 Expert 放到不同 GPU。

例如:

GPU 0 → Expert 0、1
GPU 1 → Expert 2、3
GPU 2 → Expert 4、5
GPU 3 → Expert 6、7

Router 决定 Token 应该去哪张 GPU。

因此 Expert Parallel 的核心问题不是“怎么算矩阵”,而是:

怎样把 Token 快速送到正确的 Expert。

这进一步提高了网络在 AI 集群中的重要性。


七、MoE 对云 GPU 平台意味着什么?

对于普通用户来说,Dense Model 的资源估算相对直观:

参数量 → 显存 → GPU 数量。

但 MoE 更复杂。

选算力时至少要同时看:

  • 总参数量;
  • 激活参数量;
  • Expert 数量;
  • 每 Token 激活几个 Expert;
  • 模型精度;
  • GPU HBM;
  • GPU 间带宽;
  • 推理框架是否支持 Expert Parallel。

因此以后看到一个 MoE 模型时,不能只问:

“它每次激活多少 B?”

更应该问:

整个模型到底多大,Expert 在哪里,Token 怎么在 GPU 之间移动?

这才是真正决定部署效率的问题。


八、结语:MoE 的本质,是“用网络换计算”

MoE 提供了一条非常重要的大模型扩展路径:

让模型拥有更多参数,但每次只计算其中一部分。

它降低了纯计算压力。

但同时带来了新的成本:

  • 更大的模型权重;
  • 更多 HBM;
  • 更复杂的 Expert 调度;
  • 更多 GPU 间通信。

因此可以用一句话总结:

Dense Model 更依赖算力,MoE Model 更考验“算力 + 内存 + 网络”的协同。

未来大模型继续增长时,MoE 很可能仍然会是重要架构。

但真正决定 MoE 能否低成本运行的,并不只是“稀疏”两个字。

而是:

能不能让数百个 Expert 在整个 GPU 集群中被快速、稳定地调用。

更多推荐