字节被曝训练10万亿参数大模型,张一鸣却坚持“不蒸馏“
英国《金融时报》8月7日援引知情人士报道,字节跳动正在预训练一个参数量可能高达10万亿的AI模型,而早一天晚点LatePost的说法是"超5万亿"。这个数字如果落地,将成为全球参数规模最大的公开模型——作为对比,据报道 Anthropic 的 Mythos 5 约8万亿参数,月之暗面 Kimi K3 是2.8万亿,阿里 Qwen3.8-Max 是2.4万亿。比起参数本身,这轮爆料里更值得琢磨的,是字节创始人张一鸣对"蒸馏"的明确表态。
技术本质:10万亿到底意味着什么
先说一个容易混淆的点:总参数 ≠ 单次推理成本。现在的万亿级模型基本都是 MoE(混合专家)架构,推理时只激活一小部分参数。比如 Qwen3.8-Max 总参数2.4万亿,激活参数约95B(据报道)。所以"10万亿"更多代表模型的能力容量上限,你每次调用掏的算力钱,主要取决于激活参数。
这就能解释一个现象:DeepSeek V4 Pro 只有1.6万亿参数,但在不少基准测试里和更大的模型互有胜负。参数规模竞赛是真实存在的,但它决定的是"天花板有多高",不是"你现在就能摸到顶"。
变了什么,没变什么
张一鸣在 Seed 全员会上的表态,据晚点等媒体报道,核心是反对蒸馏——他认为蒸馏本质上是在复制已有能力,沿着这条路最多只能不断逼近对手,很难真正超越。字节甚至早在2023年4月就禁止把GPT生成的数据混入自家训练集,据报道2026年AI基础设施资本开支超过2000亿元。这是"从追分变成换桌"的打法:与其在别人画好的赛道里追赶,不如赌一次更大的预训练。
没变的是"大力出奇迹"的惯性。受限芯片管制,字节只能大量用 H20,据报道靠的是扩大集群规模、提升资源利用率来补差距。另外,梁汝波在8月6日的全员会上坦承豆包在AI Coding方面不算突出,还拿 Claude Code 举例;张一鸣据报也高薪挖来 DeepSeek 核心研究员郭达雅负责 Coding。大厂把火力集中到编程能力上,对普通开发者其实是好事——AI 编程工具会越来越能用、越来越便宜。
对普通开发者:四个数字看模型,别只看一个
现在选模型,我建议看四样东西:总参数(能力上限)、激活参数(单次成本)、上下文长度、API价格。总参数是营销数字,激活参数才是你实际掏的钱。
想验证一个开源模型的 MoE 配置,用 transformers 就能查(代码真实可运行):
from transformers import AutoConfig
# Qwen3-30B-A3B 是真实开源的小尺寸 MoE 模型
config = AutoConfig.from_pretrained("Qwen/Qwen3-30B-A3B", trust_remote_code=True)
print("总层数:", config.num_hidden_layers)
print("MoE 专家数:", config.num_experts)
print("每 token 激活专家数:", config.num_experts_per_tok)
本地部署可以用 vLLM:
vllm serve Qwen/Qwen3-30B-A3B --max-model-len 32768
至于选择建议:据报道 Qwen3.8 的 API 国内定价为输入12元/百万tokens、输出36元、隐式缓存命中1.5元,加上 Kimi K3、DeepSeek V4 Flash、腾讯混元 Hy3 这些已开源的模型,普通业务完全够用,没必要等10万亿那个巨兽——就算真发布,大概率也是以 API 形式出现,本地跑不起。
几个坑提醒一下:别为"参数最大"付费,能力还得看具体任务的第三方评测;MoE 模型部署时显存要看激活参数而不是总参数;大厂宣传的"自主编程十几天交付项目"目前还是极限场景,别拿它当日常预期。
结尾
10万亿参数能不能跑通,最早要到2026年底甚至2027年初才有发布可能(据报道预训练周期3到6个月)。参数军备竞赛没结束,但决定你手上AI好不好用的,可能从来不是那个最大的数字。你怎么看,评论区聊聊。
更多推荐
所有评论(0)