开源了,但你可能跑不动:部署 Kimi K3 真正要多少算力
·
开头
Kimi K3 权重已经公开:2.8T MoE、104B 激活、原生 MXFP4,官方还把 vLLM / SGLang recipe 摆出来了。但这不等于「下载就能私有化」。门槛不在软件,而在聚合显存与互联规模——绝大多数团队会在机柜账单前停下来。
核心分析
第一层:权重本身就约 1.56 TB。
实测 checkpoint 约 1560.9 GB(96 个 safetensors),不是坊间常说的「2.8T×4bit≈1.4TB」。MXFP4 有效比特约 4.25,注意力、共享专家、LM Head、视觉塔等还没被压到 4bit。vLLM recipe 直接写明:MXFP4 变体最低约 1680 GB 显存——这还只是「能加载」,不含高并发 KV 与通信缓冲。
第二层:能加载 ≠ 能服务。
单机 8×H200(约 1128 GB)装不下权重;常见可行起步是:
| 路线 | 大致配置 | 定位 |
|---|---|---|
| Blackwell 单机 | 8×B300 / GB300(约 2.3 TB) | day-0 最省心 |
| Hopper 多机 | 2×(8×H200),TP=16 | 存量 Hopper 的务实解 |
| 存量 H100 | 约 32×H100(4 节点) | 容量够,但互联与运维更重 |
| AMD | 至少 8×MI355X | ROCm 官方路线 |
Moonshot 明确建议:64 卡及以上 supernode 才更像生产吞吐形态。原因是 MoE 专家并行吃高带宽通信域;卡少了能跑通 demo,吞吐和稳定性会难看。1M context 在 KDA 下单序列 KV 并不夸张,真正吃显存的是并发数 + 常驻 recurrent state。
第三层:对谁有用,怎么落地。
- 有合规/数据不出域硬约束、且日均 token 极大:自建才谈得上 ROI,且必须按「集群 + 推理平台 + 值班」立项,不是买几张卡。
- 研发试用、Agent 编排、长程编码:走官方 API 更理性——缓存命中输入约 $0.30/MTok,编码场景官方称命中率可很高。
- 中小团队:别被「开源」绑架;更划算的是 API + 本地小模型分流,而不是硬上 2.8T。
苍狮技术团队观点
- 被高估的是「开源=可私有化」;低估的是运维与互联成本。
- 短期价值:API 立刻可用;自建只适合已有多机 HBM 集群的组织。
- 长期价值:开源压低了「3T 级」能力的获取门槛,但算力与调度仍是护城河。
- 是否值得投入:没有稳定高流量与集群能力,不值得;有,则按「≥1.7TB 聚合显存起步、生产看 64 卡级」做预算,而不是按消费卡幻想。
总结
Kimi K3 的真实门槛是:约 1.56TB 权重 + ≥1.68TB 聚合显存起步,生产更接近 64 卡 supernode——开源降低的是权限,不是机柜。
更多推荐


所有评论(0)