Note

  • Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。
    • KDA 解决“长而便宜”,
    • Gated MLA 解决“关键处要准”,
    • AttnRes 解决“超深网络里信息别丢”,
    • MoE 解决“容量要大但每次只激活一小部分”
  • 进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。
  • Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。KDA 为注意力扩展提供了高效基础,AttnRes 则不是简单地在各层均匀累积表示,而是有选择地跨深度检索表示。
  • 局限性:过于主动,Kimi K3 的训练重点优化了长程、高难任务。因此,在任务执行过程中遇到小问题或用户意图模糊时,它可能会替用户做出非预期的决定。如果希望 agent 更有边界感、不要过于自由发挥,请在 system prompt 或 AGENTS.md 中对 Kimi K3 施加更明确的行为约束。
  • 核心定位:首个开放权重的 3T 级 MoE 基座,同时推进「预训练 Scaling」与「测试期 Scaling」,在 1M 上下文 Agentic 场景下逼近闭源旗舰水平。

一、研究动机:开源生态的“双轴困境”

过去两年大模型能力提升依赖两条核心 Scaling 轴:

  1. 训练期 Scaling:更大参数量、更多训练数据(传统预训练路径)
  2. 测试期 Scaling:RL + 自适应思考预算 + 工具调用(o-series、Claude 扩展思考、DeepSeek-R1、Kimi K1.5/K2.5 已验证)

但当前开源生态存在明显失衡:

  • ✅ 测试期 Scaling(推理、RL、工具调用)进展迅速
  • ❌ 训练期 Scaling 长期停滞在 1T 级参数天花板(主流开源模型总参 ≤1T)

这导致一个危险趋势:开源社区在相似规模的预训练基座上堆砌复杂 RL,最终会陷入能力收敛,与最强闭源系统的基座代差持续扩大

Kimi K3 的核心动机:打破单轴依赖,将两条 Scaling 轴同时推向前沿:

  • 预训练基座升级至 2.8T 总参数 / 104B 激活参数(开放权重界首个 3T-class 模型)
  • 测试期支持多档 Reasoning Effort、1M 上下文长程 Agent 轨迹、大规模工具调用

总结:不让开源模型停留在“闭源一年前的中等基座 + 强推理”的状态,而是把基座能力也拉到闭源旗舰同量级。


二、论文核心:架构 / 训练 / 基建的系统级创新

Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。

虽然 Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但它在我们的整套评测中展现出前沿水平的能力,并稳定超过了其他所有模型。

Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建。这两项架构更新,都是为了让信息在更长序列和更深模型中流动得更顺畅。也进一步扩大了 Mixture of Experts(MoE)的稀疏度:结合 Stable LatentMoE 框架后,模型可以在 896 个专家中高效激活 16 个。再加上训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍,能更有效地把算力转化为能力。

2.1 模型架构:三维信息流增强

Kimi K3 的架构设计围绕「序列长度 / 网络深度 / 模型宽度」三个维度展开,系统性解决长上下文、深层梯度、极端稀疏三大挑战。
在这里插入图片描述

(1)序列维:Hybrid Attention(KDA × Gated MLA,3:1)
  • 混合策略:每个 Block 包含 3 层 Kimi Delta Attention(KDA) + 1 层 Gated MLA,末层强制使用 MLA 保证全局注意力覆盖。
  • KDA 原理:基于 delta-rule 递推 + 通道遗忘门,用固定大小的递归状态替代随序列长度增长的 KV Cache,将序列复杂度从 Transformer 的 O ( n 2 ) O(n^2) O(n2) 降至线性。
  • 数值稳定优化:将 decay 参数化从负 Softplus 改为 有下界的 scaled-sigmoid g min = − 5 g_{\text{min}}=-5 gmin=5),确保 16-token 块内的倒数缩放因子落在 BF16 动态范围内,对角线/非对角线计算均可走 Tensor Core 加速。
  • MLA 适配:移除所有 MLA 层的 RoPE(采用 NoPE),位置信息由 KDA 的递推门控隐式编码;MLA 输出新增 输入依赖的全秩门控,增强通道选择性。

在这里插入图片描述

(2)深度维:Attention Residuals(AttnRes)
  • 核心思想:标准残差是“均匀累加前序信息”,AttnRes 让每一层通过可学习的 pseudo-query,对 Embedding + 所有前序 Block 输出 做 softmax 加权检索,突破深度维度的信息瓶颈。
  • 工程优化:采用 Block AttnRes(将 93 层划分为 9 个 Block),内存占用从 O ( L d ) O(Ld) O(Ld) 降至 O ( N d ) O(Nd) O(Nd),推理时可通过 online softmax 高效合并跨 Block 结果。
  • 收益:跨层信息路由更精准,训练效率提升约 25%,额外计算开销 <2%。
(3)宽度维:Stable LatentMoE(896 专家 / Token 激活 16)

针对极端稀疏(1.8% 激活率)下的训练不稳定问题,提出三组件解决方案:

  • 归一化路由:路由专家在 latent 空间( ℓ = 3584 \ell=3584 =3584,为隐维的 0.5x)运算,聚合后经 RMSNorm 再升维,减少激活爆炸风险。
  • SiTU-GLU 激活:替换 SwiGLU,采用 β 1 = 4 \beta_1=4 β1=4(门控分支)、 β 2 = 25 \beta_2=25 β2=25(上分支)的软上限设计,大值有界,兼顾 SwiGLU 的局部响应特性与数值稳定性。
  • Quantile Balancing(QB)负载均衡:摒弃辅助 Loss,直接将专家偏置设置为 router-score 的 ( 1 − k / n ) (1-k/n) (1k/n) 分位数,无需手动调整步长,通过直方图估计全局分位数,实现 896 路专家的完美负载均衡。

每层的共享专家固定为 2 个,保留全宽路径处理通用特征。

(4)原生视觉与优化器
  • MoonViT-V2:27 层 ViT(401M 参数),完全从零用 Next-Token Prediction 预训练,不依赖 SigLIP 等对比预训练初始化,梯度稳定性显著优于拼接式方案。
  • Per-Head Muon 优化器:将 Q/K/V 投影矩阵按头拆分,分别进行 Newton-Schulz 正交化,避免大梯度头压制小梯度头的更新,提升训练稳定性。
📊 代际对比:Kimi K2 vs Kimi K3
配置项 Kimi K2 Kimi K3 变化
总参数量 1.04T 2.78T ↑167%
激活参数量 32.6B 104.2B ↑220%
层数 61 93 ↑52%
路由专家数 384 896 ↑133%
Token 激活专家数 8 16 ↑100%
训练上下文长度 128K 1M
注意力机制 MLA Hybrid KDA-MLA -
激活函数 SwiGLU SiTU-GLU -
ViT 参数量 - 401M -

2.2 预训练与长上下文扩展

  • 数据配方:覆盖 Web Text / Code / Mathematics / Knowledge 四大文本域,以及图像/视频多模态语料;知识/数学数据采用风格多样的 rephrase 并验证保真度;视觉数据包含 SVG/CAD/网页/游戏等程序化多模态样本。
  • 训练策略:采用 Cosine Decay 学习率调度(报告称在各自最优超参设置下稳定优于 WSD),1% 线性预热,Per-Head Muon 优化器 + QB 负载均衡。
  • 长上下文扩展
    • 采用 NoPE 位置编码,通过 KDA 的递推门控隐式编码位置信息,无需 RoPE 插值/缩放即可直接外推至 1M 上下文
    • 四阶段课程学习:8K → 64K(预训练)→ 256K → 1M(Cooldown),将高成本长序列计算集中在训练后期。
    • 长上下文数据经过严格清洗、去重、上采样,并合成需要跨 1M Token 才能解决的复杂任务,避免注意力退化为局部模式。
  • Scaling Efficiency:综合架构/数据/训练优化,整体 Scaling 效率较 Kimi K2 提升 约 2.5 倍(相同算力下获得更低验证损失)。

2.3 后训练:RL × 多域 × 多档努力 × 蒸馏

(1)三阶段流程
  1. SFT 冷启动:用 XTML 模板序列化 Agent 轨迹,构建大规模指令数据集;从 SFT 阶段开始引入量化感知训练(QAT),采用 MXFP4 权值 + MXFP8 激活。
  2. 多域多档 RL:在三个领域(General / General-Agent / Coding-Agent)各训练低/中/高三档 Reasoning Effort 的专家模型,共 9 个专家。
  3. 多教师在线蒸馏(MOPD):将 9 个专家的能力整合到单一模型中,采用带截断的 on-policy 蒸馏奖励,稳定训练过程。
(2)RL 核心算法
  • Partial Rollout:允许部分轨迹完成后立即启动优化,未完成的轨迹跨迭代续跑,缓解长 horizon 任务的尾延迟问题。
  • Token 预算控制:为每个问题关联初始思考预算,超过阈值则奖励置 -1,通过分阶段退火预算乘数 τ \tau τ 得到不同努力档位的专家。
  • Agentic GRM:针对不可验证任务,采用“生成 rubric → 对照评分”的生成式奖励模型,并引入冗长惩罚避免奖励黑客。
(3)Agentic 环境
  • 统一白盒 Harness:将工具接口、系统提示、上下文管理、技能/记忆/子 Agent 模块化,动态组合模拟不同 Agent 框架(Claude Code/Codex 等),避免过拟合单一工具范式。
  • 知识图谱导引任务合成:构建自进化分层知识图谱,Agent 驱动节点扩展,基于图采样生成多样化训练任务。
  • 专项环境:Kernel 优化沙箱(支持 CUDA/Triton 等,奖励结合正确性与性能)、个人助理 Mock App(Gmail/Notion 级,支持千级工具调用/百万 Token 轨迹)、自主执行任务(AET,黑盒系统复刻等)、前端开发环境(容器化沙箱,支持多类 Web 工件生成)。
(4)部署感知优化
  • 量化推理:MoE 专家权重量化为 MXFP4,激活用 MXFP8,非专家组件保留高精度,QAT 贯穿全流程消除训练-推理 mismatch。
  • 投机解码:复用预训练的 MTP 层微调为 EAGLE-3 Draft 模型,融合低/中/高层特征,直接优化 LK 接受率损失,提升推理速度。

2.4 基础设施:算法-系统协同设计

Kimi K3 采用 Stable LatentMoE,在 896 个专家中实际激活 16 个。在这样的稀疏度下,路由和优化成为关键挑战。Quantile Balancing 直接根据路由分数的分位数分配专家,避免启发式更新和敏感的平衡超参数;Per-Head Muon 则将 Muon 扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应。Sigmoid Tanh Unit(SiTU)和 Gated MLA 分别增强激活控制和注意力选择性。这些改进共同支持了 2.8 万亿参数规模下稳定、高效的训练。

Kimi K3 从 SFT 阶段开始采用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以适配更广泛的硬件。为避免在大规模专家并行中因专家负载不均影响吞吐,我们引入了完全均衡的专家并行训练方法,使用静态形状,并且关键路径上不需要主机同步。由于推理效率同样受益于更大的高带宽通信域,我们建议在 64 个或更多加速器组成的 supernode 配置上部署 Kimi K3。

最后,由于 KDA 给传统 prefix caching 带来了新的挑战,我们已向 vLLM 社区贡献了对应实现,并将随模型一同发布。借助带 prefill cache 的 KDA,即使在大模型规模和长上下文条件下,我们也能以很有竞争力的 token 价格提供 Kimi K3 服务。

(1)KDA 系统协同
  • FlashKDA Kernel:重叠块内并行计算与跨块状态传播,训练/ Prefill 性能显著优于 Triton 参考实现。
  • KDA Context Parallelism(KCP):将递归状态拆分为“转移矩阵”和“零初始状态”两部分,通过 Prefix Scan 重组跨设备状态,仅需固定大小的 All-Gather 通信,实现线性计算扩展。
(2)3T 级预训练基建
  • MoonEP:通过动态冗余专家实现完美负载均衡(每 Rank 冗余专家 ≤ E/R),静态计算形状消除逐层 Host 同步,零拷贝通信减少内存碎片,工作负载感知的 GEMM 调度隐藏专家间负载不均。
  • 显存优化:统一激活管理器(支持 FP8 量化/重算/Offload 灵活组合);PP 间激活远程卸载平衡显存;ZeRO-2 梯度分片并卸载至 CPU;Muon 正交化采用 P2P 通信而非全收集,降低通信量。
  • 视觉编码器优化:动态上下文并行处理大图像/视频;将 ViT 计算拆分并隐藏在 PP Bubble 中,几乎消除视觉编码额外开销。
(3)1M Token Agentic RL 基建
  • 外部 KV Cache Pool:活跃解码块驻留 GPU,空闲前缀写回 CPU DRAM,KDA 状态与 MLA KV Cache 生命周期对齐,大幅降低长上下文前缀 Miss 成本。
  • Rollout 自动节流调度:基于活跃请求数、队列长度、KV Cache 利用率动态调整并发,避免 KV Cache 压力峰值。
  • AgentENV 沙箱:基于 Firecracker 微 VM,支持增量 Checkpoint(133ms)/Resume(49ms)、Pause/Resume/Fork/Snapshot 操作,内存超配比达 6.5×;训练期间共创建 51,219,741 个沙箱,覆盖 1,505,678 个镜像。
(4)推理与服务
  • KDA 感知前缀缓存:将固定大小的 KDA 递归态与分页的 MLA KV Cache 统一管理,细粒度哈希(512 Token)匹配 MLA 前缀,稀疏保存 KDA 状态检查点,实现 1M 上下文前缀的高效复用。
  • 缓存感知亲和调度 + 预算准入控制:提升集群资源利用率,保障长上下文请求的服务质量。

三、实验结果

核心结论

Kimi K3 整体性能仍略逊于最强的闭源模型 Claude Fable 5GPT-5.6 Sol,但在其余开放/闭源对比模型中持续领先,是开放权重模型的 SOTA。
在这里插入图片描述

代表性基准表现(Max/XHigh 思考档,Vendor 口径)

任务类型 基准名称 Kimi K3 对比模型(Fable 5 / Sol)
长程编码 SWE Marathon 42.0 Fable 5: 35 / Sol: 39
编码综合 ProgramBench 77.8 Fable 5: 76.8 / Sol: 77.6
终端工具 Terminal-Bench 2.1 88.3 Fable 5: 88.0 / Sol: 88.8
深研检索 BrowseComp 91.2 Fable 5: 88.0 / Sol: 90.4
知识推理 GPQA-Diamond 93.5 与 Fable 5/Sol 同档
前端开发 Frontend Code Arena ~1679 Elo (第1) 优于 Fable 5/Sol
文档视觉 OmniDocBench 91.1 Fable 5: 89.8 / Sol: 85.8
多模态 MMMU-Pro 81.6 接近 Fable 5/Sol
视频理解 Video-MME 90.0 接近 Fable 5/Sol

第三方评估

Artificial Analysis Index v4.1 综合得分:Kimi K3 ≈ 57.1,Fable 5 ≈ 59.9,Sol ≈ 58.9,Opus 4.8 ≈ 55.7 —— 开放权重第一,总体第四

Scaling 效率

在相同 OOD 验证集上,Kimi K3 相较 Kimi K2 实现 约 2.5 倍的整体 Scaling 效率提升(即相同算力可获得更低验证损失,或达到相同损失节省约 60% 算力)。

测试例子

1、GPU 编译器开发
进一步测试了 Kimi K3 能否从零构建一套 GPU 编程系统。Kimi K3 开发了 MiniTriton:一款紧凑的类 Triton 编译器。它基于 MLIR 构建了自己的 tile 级中间表示层,并实现了完整的优化 pass 到 PTX 代码生成流水线。
在其支持的 Roofline 基准测试中,MiniTriton 的性能达到或超越 Triton 和 torch.compile,并在部分工作负载上优于 Triton。目前它支持 FP32 和 FP64 计算,TF32 和 BF16 还在开发中。我们并不期待它早期的 Tensor Core 实现能超过已经高度优化的 Triton,但结果说明:在没有针对 benchmark 走捷径、也没有明显硬编码优化的情况下,MiniTriton 已经能生成有竞争力的 GPU 代码。

2、3D 开放世界游戏
在这里插入图片描述

3、Kimi K3 可以打通科学文献与可执行代码,自主完成复杂计算研究流程的实现、验证和分析。

Kimi K3 用约两小时完成了通常需要一名资深研究人员一到两周才能完成的工作。为了复现计算天体物理中的 I-Love-Q 普适关系,它阅读并交叉验证了 20 多篇论文,实现了完整的数值流程,评估了 300 多种状态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并产出了一个用于探索结果的交互式 HTML 仪表盘。

4、视频剪辑
Kimi K3 擅长动效设计、动画和视频剪辑,因为它原生的多模态架构可以在同一个模型中理解文字、图像和视频。
(1)在一个案例中,K3 制作了一支介绍自己架构的「3Blue1Brown 」风格动态图形讲解视频,把技术概念转化为动画图示和转场,时长 4 分半
(2)另一个案例中,Kimi K3 用 56 段原始素材剪出了自己的品牌视频,完成了选片、动作匹配剪辑、逐帧卡点、音频处理,以及多轮修改。像这样信息密度很高的短视频,通常需要有经验的剪辑师花 1 到 2 个工作日完成;新手则可能需要 3 到5 天


四、深度分析:Kimi K3 的行业意义

1. 填补开源模型的“基座代差”

过去开源模型最多只能对标闭源半年前的推理能力,但基座参数量普遍落后 2-3 倍。Kimi K3 首次将 2.8T 总参、104B 激活参数量、1M 上下文的基座完全开放权重,让社区可以白盒研究 3T-class 模型的训练、均衡、服务全流程,而非仅依赖蒸馏闭源输出。

2. 线性注意力在旗舰模型的首次完整落地

KDA 并非全新概念(delta-rule/linear attention 已在小模型验证),但 Kimi K3 通过 3:1 混合 MLA、有界衰减参数化、跨设备 KCP、前缀缓存联合管理,完成了线性注意力从“实验室玩具”到“旗舰模型核心组件”的工程闭环。AttnRes 则针对性解决了深层网络的梯度瓶颈,与 KDA 形成正交优化。

3. 极端稀疏 MoE 的稳定训练范式

896 专家、1.8% 激活率的极端稀疏场景下,激活爆炸和负载失衡是核心难题。Kimi K3 没有依赖单一“魔法参数”,而是通过 QB 负载均衡、SiTU-GLU 激活、MoonEP 通信优化、显存管理的系统工程方案解决问题——这也是其开源 MoonEP/FlashKDA/AgentENV 的核心原因:脱离配套基建,单纯权重难以复现效果。

4. 后训练重心明确转向“Agent 寿命”

Partial Rollout、微 VM 沙箱、外部 KV Pool 等一系列设计,都指向同一个目标:支持百万 Token 级的多轮工具调用 RL。其在 SWE Marathon、BrowseComp、Frontend Arena 等需要长程规划的基准上表现突出,正是这一设计思路的直接体现。

5. 边界与局限

报告坦诚 Kimi K3 仍存在差距:

  • 综合能力仍落后于 Claude Fable 5 和 GPT-5.6 Sol,尤其在知识可靠性(AA Omniscience 得分 K3≈18,Fable 5≈40)、极长链稳定性上。
  • 服务权重达 ~1.5TB(MXFP4 量化后),自部署需要数据中心级工程能力,并非单机可运行的“玩具模型”。

总结定位

Kimi K3 不是一篇“单点技巧论文”,而是一次将 3T 基座 + 1M Agentic RL + 开放权重 + 全栈基建打包交付的系统工程。对学术界,它提供了可复现的超大规模模型训练配方;对工业界,它证明了开源阵营有能力跟进闭源的同构 Scaling 路线——尽管闭源旗舰目前仍保持半步到一步的领先优势。

Reference

[1] Kimi K3:智能的新前沿
[2] kimi k3官方开放平台,https://platform.kimi.com/docs/guide/kimi-k3-quickstart
[3] Kimi K3: Open Frontier Intelligence
[4] 《简单谈谈K3的MoE和Attention》 https://kexue.fm/archives/11848

更多推荐