一文讲清 Kimi K3
月之暗面的 Kimi K3 发布了,直接冲上 Arena 榜首,马斯克也点了赞。它是首个在前端代码,长程代理任务等维度超越闭源模型的开源AI系统。
朋友圈和技术社区都在聊。
全球首个开源的 3 万亿参数大模型。
参数量 2.8 万亿,上下文 100 万 token,原生支持图片和视频。月之暗面官方原话是"整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol",但在自家评测套件中"consistently outperforming other tested models"。坦白讲:闭源最顶的两个还没打过,但开源阵营里已经是绝对的第一。
Arena 榜首 + 马斯克点赞
Arena 是业内最被认可的真人盲测排行榜,K3 能登顶说明在真实用户偏好投票中胜出了。
马斯克一直推崇开源路线,K3 恰好是开源阵营最强的那个,点赞逻辑很自洽。话题效应有,但能让一个同时造火箭和搞 AI 的人公开认可,本身说明了技术实力。
不是堆参数,是效率革命
2.8 万亿参数,很多人第一反应是"又堆算力"。但月之暗面给的核心数据是:相比 K2,扩展效率提升约 2.5 倍。 同样的算力,多产出 1.5 倍的智能,靠的是架构层面的重新设计。
几个硬核案例:
- GPU 内核优化:K3 独立完成四个任务的性能优化,和 Claude Fable 5 有来有回,大幅超过 Opus 4.8 和 GPT 5.5/5.6。
- 从零造 GPU 编译器:K3 开发了 MiniTriton,完整的 tile-level IR、优化 pass、PTX 代码生成管线,性能和 Triton、torch.compile 持平,部分负载超过。
- 自主设计芯片:48 小时无人值守,用开源 EDA 工具设计了一颗芯片,4mm²,8700+ tokens/s 解码吞吐。
最后一个案例的原话是"a chip built by a model, for a model",模型给自己造硬件,确实有点科幻的意思。
底层架构:一次全面升级
K3 的架构创新不是单点突破,是一套从注意力机制到训练优化器的全链路重写。分三个层次拆开讲。
第一层:注意力机制
Kimi Delta Attention(KDA)
传统 Transformer 的全注意力,计算量随序列长度平方增长,序列一长就吃力,信息在层间传递还会衰减。
KDA 是月之暗面自研的混合线性注意力:线性注意力处理大部分计算,保持 O(n) 复杂度;标准注意力在关键位置介入,保精度。两者结合,计算效率上去了,长序列里的信息也不会走丢。
Attention Residuals(AttnRes)
残差连接解决梯度消失,大家都知道。但注意力计算本身会稀释信息,尤其模型深的时候。AttnRes 给注意力机制单独设计了残差通路,确保原始信息不被注意力计算淹没。
KDA 管序列维度的信息流,AttnRes 管深度维度的信息流,两者配合解决了大模型在长序列和深网络上的双重瓶颈,这是 K3 能撑 100 万 token 上下文和 2.8 万亿参数的根基。
MoBA:混合块注意力
月之暗面 2025 年初发表的工作。思路是把 MoE 的选择性激活搬到注意力里:上下文切成块,门控网络为每个 query 动态选最相关的几块来算注意力,不跟整个序列全连接。
效果:100 万上下文下比全注意力快 6.5 倍,1000 万下快 16 倍,大海捞针和 RULER 等基准测试中性能无损。K3 的百万级上下文窗口,背后有 MoBA 的支撑。
第二层:稀疏专家
Stable LatentMoE:896 选 16
注意力管"怎么看信息",MoE 管"怎么用算力"。
K3 把 2.8 万亿参数分成 896 个专家,每次推理只激活 16 个,激活率 1.8%。知识总量是万亿级的,实际计算量只相当于一个大号密集模型。
难点在"Stable"。MoE 训练的经典问题是专家负载不均:有的被用烂了,有的几乎没被激活,训练容易崩。Stable LatentMoE 专门解决这个问题,让 896 个专家都能被有效训练。
架构上每个 Block 里采用 Shared Expert + Routed Expert 混合设计。Shared Expert 处理通用知识,所有 token 必经;Routed Expert 由 Router 按内容动态分配,负责领域特定知识。通用能力有底线,专家分配够灵活。
Gated MLA
DeepSeek 提出的 MLA 通过低秩压缩 KV 缓存省内存,K3 在此基础上加了门控,精细控制哪些信息该压缩、哪些该保留。
整个 Block 的数据流是 KDA → Stable LatentMoE → Gated MLA → Stable LatentMoE,四层交替,每层带 Conv(局部特征提取)和 L2 Norm(训练稳定)。
第三层:训练方法
Muon 优化器
月之暗面 2025 年初发表的研究。基于矩阵正交化的优化器,相比 AdamW,样本效率高 2 倍。达到同样性能,Muon 只需 AdamW 约 52% 的训练计算量。
大模型训练动辄几千万美元,训练效率翻倍意味着同样的钱训出更强的模型,或者训同样强的模型花一半的钱。
关键改进:引入权重衰减保证大规模训练稳定;精确调整每个参数的更新比例,让矩阵参数和非矩阵参数的更新均方根保持一致。月之暗面还开源了分布式 Muon 实现,用 ZeRO-1 风格做内存优化。
六项技术的协同关系
| 层级 | 技术 | 解决的问题 |
|---|---|---|
| 注意力机制 | KDA | 长序列信息流动效率 |
| 信息保留 | AttnRes | 深层网络信息衰减 |
| 长上下文 | MoBA | 百万到千万级上下文计算效率 |
| 参数利用 | Stable LatentMoE | 万亿参数的训练稳定性和推理效率 |
| 缓存优化 | Gated MLA | KV 缓存内存占用和信息控制 |
| 训练方法 | Muon 优化器 | 训练效率翻倍 |
KDA 解决注意力计算瓶颈,AttnRes 保证深层信息完整性,MoBA 让百万级上下文可行,Stable LatentMoE 让万亿参数可训练可推理,Gated MLA 优化内存和信息流,Muon 从训练侧兜底。六项技术环环相扣,才有了 2.5 倍的扩展效率提升。
多模态
K3 的视觉理解是架构原生的,不是后补的。图片、视频、文本在模型内部走的是同一套信息流。
游戏开发案例里,K3 在代码和实时截图之间迭代:写完代码,看一眼效果,发现问题,改代码,再看一眼。48 小时设计芯片那个案例,K3 需要同时看懂电路原理、EDA 工具界面、仿真波形。这些都不是"能识别图片"这种浅层能力,而是把视觉融进了推理的整个过程。
大模型下一步的竞争,参数量已经不是决定性的了,谁能把多种模态的信息融合得更好才是关键。
开源 vs 闭源
K3 和 Claude Fable 5、GPT 5.6 Sol 比,整体还差一截。但闭源巨头有海量推理算力、多年数据飞轮,月之暗面是家中国创业公司,能在这个量级上竞技本身已经很难得。
更关键的问题是:K3 是开源的。
完整权重 7 月 27 日前发布,技术报告同步。拿到权重,意味着你可以研究架构、微调部署、基于它做自己的东西。Claude 和 GPT 再强,你只能用 API,摸不到权重。开源的价值不在排行榜,在生态。
过去 12 个月里,月之暗面有 9 个月保持着开源模型的规模上限。K3 是这条路上最新的里程碑,不是偶然。
结尾
K3 的意义不在于排行榜第几,在于它证明了中国的大模型公司能在前沿架构上做出真正的原创创新。KDA、AttnRes、MoBA、Stable LatentMoE、Gated MLA、Muon 优化器,六个方向同时推进,2.5 倍效率提升,月之暗面找到了正确的 scaling 方向。
7 月 27 日,权重发布。好戏才刚开始。
更多推荐
所有评论(0)