目录

背景

官方部署门槛梳理

MXFP4 权重的意义

显存预算怎么算

方案:两台 NF5868G8 + X400 交换机

单台 NF5868G8 配置

显存分配分析

网络侧:X400 交换机

性能参考

部署注意事项

总结


背景

2025 年 7 月 27 日,月之暗面正式开源 Kimi K3。参数规模约 2.8 万亿,上下文窗口 100 万 Token,原生多模态——单看这三项指标,K3 已经是当前开源生态里参数规模最大的模型之一。

开源公告一出,评论区最高频的问题是:什么配置能跑?

本文从硬件选型、显存计算、网络拓扑三个维度,拆解一套可落地的 K3 推理部署方案。

官方部署门槛梳理

先看官方给的参考配置。

K3 官方仓库提供了两档部署 recipe:

方案 最低卡数 切分策略 前置条件
vLLM 8 卡 TP / TEP 至少 8×GB300
DEP 16 卡 Expert Parallelism 至少 8×GB300

注意这是最低配置。满血部署按 H200 模组估算,大约需要 8-16 台。如果要上生产基线,官方建议是 64 张以上加速卡搭建 Supernode。

对绝大多数团队来说,这个硬件账单基本等于劝退价。

但 K3 的发布有一个被很多人忽略的细节——它直接给了 MXFP4 权重。

MXFP4 权重的意义

以往大模型开源,通常发布 FP16 或 BF16 权重,部署方需要自己量化。这个过程不仅耗时,量化精度不当还会直接影响推理质量。

K3 的做法不同:官方直接发布 MXFP4 权重,激活侧使用 MXFP8。HuggingFace 仓库 96 个分片,总大小约 1.56TB

这意味着什么?意味着拿到权重就可以直接加载推理,不再需要量化环节。更重要的是,1.56TB 这个数字让硬件选型有了一个明确的显存下界。

显存预算怎么算

这里做一笔显存账:

部署 K3 推理时,显存占用主要分三部分:

  1. 模型权重:MXFP4 格式,≈ 1.56TB
  2. KV Cache:取决于 batch size 和序列长度,100 万 Token 上下文场景下,KV Cache 开销不容忽视
  3. 激活值:推理过程中中间激活的临时占用

1.56TB 只是门票。加上 KV Cache 和激活值的开销,实际所需显存总量必须显著高于这个数字。保守估计,2TB 以上的总显存是比较稳妥的基线。

方案:两台 NF5868G8 + X400 交换机

商红科技给出的推荐方案是两台浪潮 NF5868G8,搭配 X400 智算交换机。

单台 NF5868G8 配置

组件 规格
机型 8U
GPU 16×PRO6000D 84G(双宽)
互连 PCIe Fabric 全互连
GPU P2P 带宽 128GB/s
GPU P2P 延迟 较传统方案降低 60%+
CPU 2×6767P(第六代至强)
内存 24×64GB DDR5,32 槽
存储 2×7.68TB U.2 NVMe
电源 6×3300W 钛金,N+1 冗余
网络 400G + 10G 双口

单台显存:16 × 84GB = 1,344GB ≈ 1.34TB

两台合计:32 卡,2.68TB 总显存

显存分配分析

  • 权重占用:≈ 1.56TB
  • 剩余显存:≈ 1.12TB

这部分剩余空间用来承载 KV Cache 和激活值。对于常规 batch size 的推理场景来说,余量是足够的。如果在 100 万 Token 长度的极端上下文中跑大 batch,需要根据实际业务做显存策略调优,但不会触及显存墙。

网络侧:X400 交换机

两台 NF5868G8 之间通过 X400 400G 智算交换机互联,参数面 3.2Tbps 无阻塞 RDMA。

几个关键参数:

  • 有效带宽:95%(传统 RoCE 方案约 60%)
  • 相比 RoCE 带宽提升:约 1.6 倍
  • 二层组网能力:最多支持 8000 张 GPU 卡

两台机器的场景下,3.2Tbps RDMA 完全够用。如果未来要扩到更多节点,X400 的二层组网能力也能直接承接,不需要重新设计网络拓扑。

性能参考

NF5868G8 在同架构平台部署 DeepSeek 671B 时,推理性能相比传统 2 机 8 卡方案提升近 40%。这块的提升主要来自两个层面:

  1. PCIe Fabric 全互连:16 卡之间 P2P 带宽 128GB/s,卡间通信瓶颈被大幅压缩
  2. X400 无阻塞 RDMA:跨节点张量并行时,通信开销对吞吐的影响降到最低

K3 的 MoE 架构天然适合张量并行 + 专家并行的混合切分策略,NF5868G8 的互联拓扑正好对上这个需求。

部署注意事项

方案有了,但实际落地过程中有几个容易踩的坑:

模型切分策略:K3 的 MoE 层和 Attention 层对显存和带宽的需求不一样。TP 切多少、EP 切多少、PP 要不要加——这个组合需要根据实际吞吐量目标来调。切分策略不对,吞吐可能直接打对折。

KV Cache 管理:100 万 Token 上下文的 KV Cache 膨胀曲线不是线性的。Prefix Caching 的命中率、page size 的设定、prefill 和 decode 的显存分配比例,都需要压测之后才能确定最优参数。

散热和供电:单台 NF5868G8 满配功耗 16.5kW,两台就是 33kW。机房空调和 UPS 能不能扛住,部署前就得算清楚。

总结

K3 开源这件事,真正降低的是模型的获取门槛,不是部署门槛。但 MXFP4 1.56TB 的官方权重,加上 NF5868G8 的双机方案,确实把部署成本拉到了中型团队可以承受的区间。

2.68TB 总显存,X400 无阻塞 RDMA,交钥匙交付——这套方案的定位很清晰:不是给大厂做千卡集群的,而是给想私有化部署 K3 但预算卡在千万以下的团队。

商红科技是浪潮信息官方授权的亿元级钻石分销商,团队 300+ 人,服务过 3 万多家企事业单位,从架构设计到进场部署到 7×24 售后全程覆盖。关注这套方案的可以联系他们拿定制评估。

更多推荐