Kimi K3 开源免费,但“跑起来“的成本有多少?商红科技用 NF5868G8 算一笔明白账
目录
背景
2025 年 7 月 27 日,月之暗面正式开源 Kimi K3。参数规模约 2.8 万亿,上下文窗口 100 万 Token,原生多模态——单看这三项指标,K3 已经是当前开源生态里参数规模最大的模型之一。
开源公告一出,评论区最高频的问题是:什么配置能跑?
本文从硬件选型、显存计算、网络拓扑三个维度,拆解一套可落地的 K3 推理部署方案。

官方部署门槛梳理
先看官方给的参考配置。
K3 官方仓库提供了两档部署 recipe:
| 方案 | 最低卡数 | 切分策略 | 前置条件 |
|---|---|---|---|
| vLLM | 8 卡 | TP / TEP | 至少 8×GB300 |
| DEP | 16 卡 | Expert Parallelism | 至少 8×GB300 |
注意这是最低配置。满血部署按 H200 模组估算,大约需要 8-16 台。如果要上生产基线,官方建议是 64 张以上加速卡搭建 Supernode。
对绝大多数团队来说,这个硬件账单基本等于劝退价。
但 K3 的发布有一个被很多人忽略的细节——它直接给了 MXFP4 权重。

MXFP4 权重的意义
以往大模型开源,通常发布 FP16 或 BF16 权重,部署方需要自己量化。这个过程不仅耗时,量化精度不当还会直接影响推理质量。
K3 的做法不同:官方直接发布 MXFP4 权重,激活侧使用 MXFP8。HuggingFace 仓库 96 个分片,总大小约 1.56TB。
这意味着什么?意味着拿到权重就可以直接加载推理,不再需要量化环节。更重要的是,1.56TB 这个数字让硬件选型有了一个明确的显存下界。
显存预算怎么算
这里做一笔显存账:
部署 K3 推理时,显存占用主要分三部分:
- 模型权重:MXFP4 格式,≈ 1.56TB
- KV Cache:取决于 batch size 和序列长度,100 万 Token 上下文场景下,KV Cache 开销不容忽视
- 激活值:推理过程中中间激活的临时占用
1.56TB 只是门票。加上 KV Cache 和激活值的开销,实际所需显存总量必须显著高于这个数字。保守估计,2TB 以上的总显存是比较稳妥的基线。

方案:两台 NF5868G8 + X400 交换机
商红科技给出的推荐方案是两台浪潮 NF5868G8,搭配 X400 智算交换机。
单台 NF5868G8 配置
| 组件 | 规格 |
|---|---|
| 机型 | 8U |
| GPU | 16×PRO6000D 84G(双宽) |
| 互连 | PCIe Fabric 全互连 |
| GPU P2P 带宽 | 128GB/s |
| GPU P2P 延迟 | 较传统方案降低 60%+ |
| CPU | 2×6767P(第六代至强) |
| 内存 | 24×64GB DDR5,32 槽 |
| 存储 | 2×7.68TB U.2 NVMe |
| 电源 | 6×3300W 钛金,N+1 冗余 |
| 网络 | 400G + 10G 双口 |
单台显存:16 × 84GB = 1,344GB ≈ 1.34TB
两台合计:32 卡,2.68TB 总显存。
显存分配分析
- 权重占用:≈ 1.56TB
- 剩余显存:≈ 1.12TB
这部分剩余空间用来承载 KV Cache 和激活值。对于常规 batch size 的推理场景来说,余量是足够的。如果在 100 万 Token 长度的极端上下文中跑大 batch,需要根据实际业务做显存策略调优,但不会触及显存墙。
网络侧:X400 交换机
两台 NF5868G8 之间通过 X400 400G 智算交换机互联,参数面 3.2Tbps 无阻塞 RDMA。
几个关键参数:
- 有效带宽:95%(传统 RoCE 方案约 60%)
- 相比 RoCE 带宽提升:约 1.6 倍
- 二层组网能力:最多支持 8000 张 GPU 卡
两台机器的场景下,3.2Tbps RDMA 完全够用。如果未来要扩到更多节点,X400 的二层组网能力也能直接承接,不需要重新设计网络拓扑。
性能参考
NF5868G8 在同架构平台部署 DeepSeek 671B 时,推理性能相比传统 2 机 8 卡方案提升近 40%。这块的提升主要来自两个层面:
- PCIe Fabric 全互连:16 卡之间 P2P 带宽 128GB/s,卡间通信瓶颈被大幅压缩
- X400 无阻塞 RDMA:跨节点张量并行时,通信开销对吞吐的影响降到最低
K3 的 MoE 架构天然适合张量并行 + 专家并行的混合切分策略,NF5868G8 的互联拓扑正好对上这个需求。
部署注意事项
方案有了,但实际落地过程中有几个容易踩的坑:
模型切分策略:K3 的 MoE 层和 Attention 层对显存和带宽的需求不一样。TP 切多少、EP 切多少、PP 要不要加——这个组合需要根据实际吞吐量目标来调。切分策略不对,吞吐可能直接打对折。
KV Cache 管理:100 万 Token 上下文的 KV Cache 膨胀曲线不是线性的。Prefix Caching 的命中率、page size 的设定、prefill 和 decode 的显存分配比例,都需要压测之后才能确定最优参数。
散热和供电:单台 NF5868G8 满配功耗 16.5kW,两台就是 33kW。机房空调和 UPS 能不能扛住,部署前就得算清楚。
总结
K3 开源这件事,真正降低的是模型的获取门槛,不是部署门槛。但 MXFP4 1.56TB 的官方权重,加上 NF5868G8 的双机方案,确实把部署成本拉到了中型团队可以承受的区间。
2.68TB 总显存,X400 无阻塞 RDMA,交钥匙交付——这套方案的定位很清晰:不是给大厂做千卡集群的,而是给想私有化部署 K3 但预算卡在千万以下的团队。
商红科技是浪潮信息官方授权的亿元级钻石分销商,团队 300+ 人,服务过 3 万多家企事业单位,从架构设计到进场部署到 7×24 售后全程覆盖。关注这套方案的可以联系他们拿定制评估。
更多推荐

所有评论(0)