稀疏激活的数学账:从124B激活5.1B到GLM-5.3单任务输出5万token看大模型单位成本

如果你只看一条新闻,最近一周最"分裂"的两个数字是这样的:蚂蚁百灵8月13日开源的Ling-3.0-flash,总参数1240亿、激活参数只有51亿——只占总参数的4.1%;智谱8月14日发布的GLM-5.3,单任务平均输出约5万token,是Claude Opus 4.8同任务输出(约12万)的42%——但它每任务的"思考量"没缩水。一个数字告诉我们模型"有多大",另一个数字告诉我们模型"用了多少算力",两个数字一相除,就是这道数学题的核心——单位任务成本。本文不站队、不背书,用建模的方法把"稀疏激活"这件事拆开算清楚:激活比怎么定、每token真实成本怎么算、首token延迟为什么降,国赛里类似题型的通法是什么。

图:杭州钱江新城的天际线,蚂蚁百灵总部所在地——大模型的算力账与城市灯火同此凉热

一、先把两条新闻摆在一起

新闻时间关键数据直观含义
蚂蚁百灵开源 Ling-3.0-flash2026-08-13总参数 124B、激活 5.1B(占总参数 4.1%)模型"看上去"1240亿参数,回答一次问题只调动 51 亿
智谱发布 GLM-5.32026-08-14单任务平均输出约 5 万 token同样一个任务,GLM-5.3 写得比 Opus 4.8 短,但代码能力分提升 50%

这两条新闻单独看都是好消息:前者说明大模型可以"做大但轻跑",后者说明大模型正在"短而精"。但合起来看,它们共同回答的是同一个问题——单位任务成本到底由什么决定。把这道题做明白,需要三个模型工具:稀疏激活模型、单token成本模型、首token延迟排队模型。

二、稀疏激活模型:为什么"124B 只用 5.1B"是数学上可能的

2.1 直觉先于公式

稀疏激活(Mixture-of-Experts,简称 MoE)的直觉其实很像医院分诊:一个医院有 1240 个医生(总参数),但一个病人走进门诊只会去 5 个科室(激活参数)。医院的总服务能力由所有医生决定,但单个病人享受到的服务只来自被叫到的几个科室。MoE 模型也是这样——它有 1240 亿个参数(专家),但对每个 token 来说只激活 51 亿(少数几个专家)。

2.2 数学表达

设模型总参数为 N,激活参数为 K,激活比为 r = K / N。那么:

  • 单 token 的浮点运算量大致正比于 K(不是 N)
  • 模型"知识容量"大致正比于 N
  • 推理时的显存占用大致正比于 N(因为所有专家都要加载)

所以稀疏激活的本质是:用 N 换知识容量,用 K 换算力成本。Ling-3.0-flash 的 r = 5.1 / 124 ≈ 4.1%,意味着它享受了 124B 模型的"知识量",但只付出了 5.1B 模型的"算力价"。

主流 MoE 模型总参数 N激活参数 K激活比 r单token算力相当于的稠密模型规模
Ling-3.0-flash(蚂蚁)124B5.1B4.1%约 5.1B 稠密
Ring-2.6-1T(前代蚂蚁旗舰)约 1000B约 63B6.3%约 63B 稠密
Qwen3.8-2.4T-A95B(阿里)2400B95B4.0%约 95B 稠密
dots3-note preview(小红书)280B16B5.7%约 16B 稠密

这张表说明一个事实——激活比正在向 4%—6% 收敛。也就是说,今天的 MoE 已经不是"稀疏激活",而是"极度稀疏激活"。这也是为什么蚂蚁能在 Ring-2.6-1T 基础上把激活参数砍到 8.1%——稀疏化已经走完了技术拐点。

图:犹他州国家数据中心外景,"千亿参数、万亿参数"的模型只是这里的又一行负载

2.3 路由函数——稀疏激活里最关键的数学

稀疏激活不是"随便挑几个专家",而是由一个小型神经网络(路由器)给每个 token 选专家。路由函数 R(x) 把输入 x 映射到一个专家分布,然后选 top-K 个专家。简化版公式:

P(选第 i 个专家 | 输入 x) = softmax(R(x))_i

然后选出概率最大的 K 个专家激活,其余 999 个专家对当前 token 静默。这个机制带来三个建模问题:

  • 负载均衡:少数专家被反复选中,其他专家闲置,需要辅助损失函数平衡
  • 专家坍缩:路由器只挑"看起来顺眼"的少数专家,模型能力下降
  • 路由抖动:相近 token 被分到不同专家,结果不稳定

国赛里如果碰到"如何分配任务到若干专家/机器"的问题,路由函数就是核心:建一个 softmax 形式的分配模型,再用约束条件让分配均匀。

三、单 token 成本模型:把"算力价"算成"人民币"

3.1 成本公式

单 token 的推理成本 C 可以拆成四项:

C = C_compute + C_memory + C_io + C_overhead

其中:

  • C_compute:算力成本,正比于激活参数 K 和 token 数
  • C_memory:显存占用成本,正比于总参数 N(所有专家都要加载)
  • C_io:数据搬运成本,正比于专家规模与带宽
  • C_overhead:调度、排队、空转等

DeepSeek 在 8 月 17 日生效的新定价给出了真实的算力价格信号:

价格档位原价新价(高峰)新价(空闲)倍数变化
V4-Flash 输出2 元/百万 tokens9 元/百万4.5 元/百万高峰 4.5 倍、空闲 2.25 倍
V4-Flash 输入(缓存未命中)3 元/百万9 元/百万4.5 元/百万高峰 3 倍
V4-Flash 输入(缓存命中)0.025 元/百万0.30 元/百万0.15 元/百万高峰 12 倍

把这个价格和 Ling-3.0-flash 的激活参数对比看:

  • Ling-3.0-flash 激活 5.1B,按 DeepSeek V4-Flash 同档价格,每百万 token 输出约 9 元
  • 如果是稠密的 124B 模型,每百万 token 输出理论上要贵 24 倍(约 216 元)
  • 实际上稠密 124B 模型根本没人这么跑——根本跑不起

这就是稀疏激活的"商业账":模型大不等于用得贵。把 K / N 比从 100% 降到 4%,单 token 算力成本就降到原来的 1/24。

3.2 每任务真实成本

GLM-5.3 单任务平均输出 5 万 token,按 V4-Flash 空闲档 4.5 元/百万 token 计算,单任务输出成本约 2.25 元。Claude Opus 4.8 同任务输出 12 万 token,按其公开价格每百万输出 token 约 75 美元计算,单任务成本约 9 美元——人民币 60 多元。两者相差约 30 倍,但效果差不多。这就是稀疏激活+短输出的复合收益。

模型单任务平均输出单任务输出成本(人民币估算)编程能力档位
GLM-5.3(智谱)5 万 token约 2.25 元Terminal Bench 3.0 28.3 分
Claude Opus 4.812 万 token约 60 元Terminal Bench 3.0 约 29.5 分
倍数差0.42 倍约 1/27接近

这张表是建模里"性价比边界"的标准例子:当一项指标(成本)下降 27 倍而另一项指标(能力)几乎不变时,意味着单位投入的产出曲线出现了明显的折点。

图:英格兰银行大楼的古典立面,金融成本与算力成本遵循同样的"边际递减"曲线

四、首 token 延迟模型:60%—80% 是怎么省下来的

4.1 为什么首 token 延迟重要

Ling-3.0-flash 集成 SGLang HiCache 与 Mooncake 分层缓存后,长输入场景的首 token 延迟(TTFT)降低 60%—80%。首 token 延迟是用户感知"AI 是否在思考"的关键指标——它一长,用户就觉得卡;它一短,用户体验就流畅。

4.2 排队论模型

首 token 延迟可以建模成 M/M/1 排队系统:请求按泊松过程到达,服务时间近似指数分布,平均服务时间 μ,负载率 ρ = λ/μ。平均等待时间 W_q = ρ / (μ - λ),总延迟 W = W_q + 1/μ。当系统接近饱和(ρ→1),W 急剧上升;当系统空闲(ρ 很小),W 趋近 1/μ。

Ling-3.0-flash 把首 token 延迟降 60%—80%,意味着服务时间 1/μ 大幅缩短。背后是分层缓存的功劳:把 KV-cache 缓存到 SSD 上,每次请求不需要重新计算前面的 token 的键值对,等于把 μ 拉高数倍。

优化手段对排队模型的影响直观效果
增加并发服务数 c(M/M/c)服务台多了,等待时间 W_q 大幅下降长文本并发请求不卡
引入缓存层服务时间 1/μ 下降重复内容秒回
批处理(batching)单 token 边际服务时间下降多人同时问同样问题
模型蒸馏 / 稀疏激活服务时间 1/μ 直接下降短任务也快

把 Ling-3.0-flash 的几个数字组合起来看:激活参数 5.1B(比前代旗舰低 92%),意味着单 token 服务时间至少下降一个数量级;分层缓存把重复内容的服务时间再砍一截;这两层叠加,60%—80% 的首 token 延迟下降就成立了。

五、国赛里类似的题怎么打

数模竞赛里碰到"大模型成本""AI 算力调度""专家路由"这类题,不要直接套神经网络——评委会更看重"可解释 + 可计算"。建议三步走:

第一步:明确优化目标。把题目翻译成数学语言:最小化总成本?最小化平均延迟?最大化吞吐?三个目标相互冲突,需要加权或者帕累托。

第二步:建立简化模型。最常用的是排队论 + 路由优化。把模型看成 M/M/c 队列,把专家路由看成整数规划问题,激活参数就是服务台数。

第三步:做参数估计 + 灵敏度分析。用公开数据(如 DeepSeek 价目表)做基线,再对负载率、缓存命中率、激活比三个参数做敏感性扫描,看哪个因素对结果影响最大。

国赛题型简化模型关键参数
大模型推理成本优化M/M/c 排队 + 路由优化激活比 r、缓存命中率 h
多模型 API 调度整数规划 / 仿真任务类型分布、价格表
AI 算力需求预测时间序列 + 弹性模型用户数、并发、单价
长文本处理系统设计分层缓存 + 排队缓存层数、命中率、读写比

这些题目共同的核心是"在约束下分配资源"——和稀疏激活的 MoE 思路完全一致。学会今天这道题,国赛里类似题目就有了一个通用的解题骨架。

图:PDP-11 的逻辑电路板,大模型"千亿参数"的祖先就是这种规模的电路——单位算力成本的故事其实从 1970 年代就开始了

六、回到产业:4% 激活比会变成主流吗

把激活比压到 4%—6% 是这一轮大模型的主线。从蚂蚁 Ling-3.0-flash 的 4.1%、阿里 Qwen3.8-2.4T 的 4.0%、小红书 dots3-note 的 5.7% 看,这个区间已经收敛。如果未来两年继续往下压到 2%—3%,意味着同样一块 GPU 可以服务的并发请求再翻一倍,单 token 成本再降一半。这条曲线一旦继续下去,AI 推理的"白菜价"就不是营销话术,而是数学上的必然。

但要小心两点:第一,激活比太低会让路由器负担过重,模型能力下降;第二,缓存命中率高才能真正省到钱,没缓存场景下稀疏激活的收益会被 IO 成本吃掉一半。这两点是国赛里"何时优化有效"的标准考点——优化手段不是无条件好,要看它对应的前提条件。

七、一句话总结

稀疏激活不是魔法,是把"知识容量"和"算力消耗"分开计费的一道数学题。124B 总参数 / 5.1B 激活参数的组合,本质是把单位任务成本降到原来的 1/24,同时保留了 124B 模型的知识容量。GLM-5.3 的"短而精"则是在这条路上再叠加一个"输出长度优化"——单任务输出砍到 42%,成本又降一截。两者合起来,就是为什么今天的大模型"越大、越便宜、还能越好用"。

把这道题的骨架(稀疏激活 + 单 token 成本 + 首 token 延迟排队)记下来,国赛里碰到"AI 算力 / 资源调度 / 专家分配"类题目,直接套这套框架,评委会一眼看到你的工程化思维。

更多推荐