月之暗面这周放出了 Kimi K3,2.8 万亿参数的 MoE 模型,官方定位是全球首个开源的 3T 级别模型。完整权重要等到 7 月 27 日发布,目前技术报告还没出来,官方博客先披露了一部分架构细节。

过去一年,开源模型的参数上限一直在被刷新,Llama 3 是 405B,DeepSeek-V3 到了 671B,Kimi K2 是 1T 级别,K3 直接翻到 2.8T。月之暗面自己在博客里提到过去十二个月里有九个月由他们保持开源模型的参数上限记录,这个节奏很明确,他们在持续把 scaling law 往开源侧推。

K3 没有沿用 K2 的架构,引入了两个新的注意力组件,Kimi Delta Attention 和 Attention Residuals。官方描述里 KDA 是为超大规模注意力设计的高效基础结构,AttnRes 做的事情是跨深度选择性地取回表征而不是均匀累积,两者配合让模型在万亿参数以上的规模继续有效缩放。配合 MoE 侧的改动,K3 的整体缩放效率比 K2 提升了约 2.5 倍,也就是说同样算力能转化出更高的模型能力。

MoE 部分也做了比较激进的稀疏化。896 个专家每次激活 16 个,激活比例大概 1.8%,这个稀疏度比之前的主流开源 MoE 模型高不少。DeepSeek-V3 是 256 选 8,K2 是 384 选 8,专家数和稀疏比都在往上走。但专家多了之后路由和负载均衡会成为实打实的工程问题,K3 用了 Quantile Balancing 来做专家分配,直接从路由分数的分位数推导分配,去掉了启发式更新和一个敏感的均衡超参数。优化器侧也做了改动,Per-Head Muon 把注意力头独立优化,配合 SiTU 激活函数和 Gated MLA,这些都是为了在 2.8T 规模下训练能够稳定收敛。

训练侧从 SFT 阶段开始就用量化感知训练,权重 MXFP4、激活 MXFP8,硬件兼容性考虑得比较靠前。部署推荐配置是 64 块以上加速器的超节点,专家并行用了静态 shape、关键路径无主机同步的全平衡训练方法,这个配置门槛不低。推理效率方面 KDA 给传统 prefix caching 带来了新的挑战,月之暗面给 vLLM 社区贡献了对应的 KDA prefill cache 实现,会和模型权重一起发布,靠这个把 token 价格压到有竞争力的水平。

K3 官方主动承认了和闭源顶级模型之间还有差距,博客开篇就说整体性能仍然落后于 Claude Fable 5 和 GPT 5.6 Sol,但在评估套件上达到了前沿水平。这个姿态在国产模型发布里不多见。并且官方给出的案例覆盖了几个不太常见的方向。GPU kernel 优化测试里 K3 在 H200 和一个替代厂商 GPGPU 上优化四个任务,表现和 Fable 5(含 fallback)竞争,超过 Opus 4.8 和 GPT 5.5/5.6 Sol。K3 还从零构建了一个叫 MiniTriton 的类 Triton 编译器,自己的 IR 层跑在 MLIR 上,有优化 pass 和 PTX 代码生成流水线,部分负载性能超过 Triton 和 torch.compile,能跑通完整的 nanoGPT 训练并稳定收敛。

另一个案例是芯片设计。K3 在 48 小时自主运行里用开源 EDA 工具基于 Nangate 45nm 工艺设计了一颗给 nano 模型用的芯片,4 平方毫米内 100MHz 时序收敛,仿真 decode 吞吐 8700 tokens/s,塞了 146 万标准单元和 INT4 MAC 阵列。天体物理方向复现 I–Love–Q 通用关系,读了 20 多篇论文交叉验证,实现完整数值 pipeline,评估了 300 多个状态方程,生成 3000 多行 Python 代码加一个可交互 HTML dashboard,官方说法是正常一个有经验的研究者需要一到两周。

案例展示的是长程 Agent 能力,不是刷 benchmark 分数。K3 在 coding 方向强调的是长时间无人干预的工程任务,浏览大型代码库、操作终端工具、视觉和代码结合做游戏开发和前端,这块能力和 K2 在 Agent 方向的一脉相承。

开源竞赛的格局从 K3 这次发布能看出几个趋势。参数规模的头部玩家越来越集中,月之暗面、DeepSeek、Meta 三家在持续往上推,中小团队在这个赛道跟不起了。架构创新开始取代纯堆算力成为差异化方向,KDA、AttnRes、MLA 改进、Muon 优化器变体,各家都在基础组件上做自己的改动而不是套标准 Transformer。推理和部署的工程权重越来越高,稀疏 MoE、量化感知训练、prefix cache 优化、专家并行策略,这些工程细节直接决定模型能不能被用起来,而不只是能不能训出来。

端侧和云端这两条路径的分化也在加剧。K3 这类 3T 级模型需要 64 块以上加速器部署,走的是大规模算力集群路线,面向的是长程复杂任务和 Agent 场景。而端侧模型走的是完全相反的方向,4B 到 14B 参数,量化后在本地硬件上跑,解决数据不出设备的问题。两个方向都在快速推进,服务的场景其实不一样,不构成直接竞争。云侧大模型处理需要大规模知识和长链推理的任务,端侧模型处理隐私敏感、低延迟、高频调用的场景,混合部署会是后续一段时间的主流形态。

K3 权重 7 月 27 日正式放出,到时候可以实际跑一跑看真实表现,技术报告也会同步出来,到时候架构细节会更清楚。

更多推荐