开头

Kimi K3 权重已经公开:2.8T MoE、104B 激活、原生 MXFP4,官方还把 vLLM / SGLang recipe 摆出来了。但这不等于「下载就能私有化」。门槛不在软件,而在聚合显存与互联规模——绝大多数团队会在机柜账单前停下来。

核心分析

第一层:权重本身就约 1.56 TB。
实测 checkpoint 约 1560.9 GB(96 个 safetensors),不是坊间常说的「2.8T×4bit≈1.4TB」。MXFP4 有效比特约 4.25,注意力、共享专家、LM Head、视觉塔等还没被压到 4bit。vLLM recipe 直接写明:MXFP4 变体最低约 1680 GB 显存——这还只是「能加载」,不含高并发 KV 与通信缓冲。

第二层:能加载 ≠ 能服务。
单机 8×H200(约 1128 GB)装不下权重;常见可行起步是:

路线 大致配置 定位
Blackwell 单机 8×B300 / GB300(约 2.3 TB) day-0 最省心
Hopper 多机 2×(8×H200),TP=16 存量 Hopper 的务实解
存量 H100 约 32×H100(4 节点) 容量够,但互联与运维更重
AMD 至少 8×MI355X ROCm 官方路线

Moonshot 明确建议:64 卡及以上 supernode 才更像生产吞吐形态。原因是 MoE 专家并行吃高带宽通信域;卡少了能跑通 demo,吞吐和稳定性会难看。1M context 在 KDA 下单序列 KV 并不夸张,真正吃显存的是并发数 + 常驻 recurrent state

第三层:对谁有用,怎么落地。

  • 有合规/数据不出域硬约束、且日均 token 极大:自建才谈得上 ROI,且必须按「集群 + 推理平台 + 值班」立项,不是买几张卡。
  • 研发试用、Agent 编排、长程编码:走官方 API 更理性——缓存命中输入约 $0.30/MTok,编码场景官方称命中率可很高。
  • 中小团队:别被「开源」绑架;更划算的是 API + 本地小模型分流,而不是硬上 2.8T。

苍狮技术团队观点

  • 被高估的是「开源=可私有化」;低估的是运维与互联成本。
  • 短期价值:API 立刻可用;自建只适合已有多机 HBM 集群的组织。
  • 长期价值:开源压低了「3T 级」能力的获取门槛,但算力与调度仍是护城河。
  • 是否值得投入:没有稳定高流量与集群能力,不值得;有,则按「≥1.7TB 聚合显存起步、生产看 64 卡级」做预算,而不是按消费卡幻想。

总结

Kimi K3 的真实门槛是:约 1.56TB 权重 + ≥1.68TB 聚合显存起步,生产更接近 64 卡 supernode——开源降低的是权限,不是机柜。

更多推荐