Kimi K3 技术分析——2.8T 参数的 MoE 猛兽,到底有多强?
副标题: 2026 年 7 月 16 日,Moonshot AI 发布了 Kimi K3——2.8 万亿参数的 MoE 巨兽、896 专家、100 万 token 上下文、承诺 7 月 27 日前开源。它是"最强国产模型"吗?和 Claude Fable 5、GPT-5.6 Sol 比处在什么位置?本文做一次全面的技术调研。
一、K3 是什么来头?
2026 年 7 月 16 日,Moonshot AI 发布了他们的最新旗舰模型 Kimi K3。
这条消息在 AI 圈引发了一轮不小的震动,因为几个数字足够震撼:
- 2.8 万亿参数——比同为 MoE 的 DeepSeek V4-Pro(1.6T)大 75%
- 896 个 Expert——每 token 激活 16 个
- 100 万 token 上下文——行业第二,仅次于 Gemini 3.1 Ultra 的 2M
- 7 月 27 日前开源权重——可能成为首个 3T 级开放权重模型
而且,这不仅仅是"大"。Moonshot 在这代引入了在论文和代码上均已开源的全新注意力架构 Kimi Delta Attention(KDA),号称 KV Cache 压缩 12.5 倍、解码速度提升 6.3 倍。
K2(2025 年 7 月)→ K2.5 → K2.6 → K2.7 Code(2026 年 6 月)→ K3(2026 年 7 月),一年时间,Moonshot 完成了一次跃迁。
二、硬核规格:K3 的核心数字
核心参数总览
| 项目 | 数值 |
|---|---|
| 总参数量 | 2.8 万亿 (2.8T) |
| 架构 | 稀疏 MoE |
| Expert 数量 | 896 |
| 每 token 激活 | 16 个 Expert |
| 激活参数量 | ~50B |
| 激活比 | ~1.8%(激活 50B / 总参 2.8T) |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉能力 |
| 关键创新 | Kimi Delta Attention + Attention Residuals |
| 开放计划 | 2026-07-27 前开放权重(修改版 MIT 协议) |
几组值得玩味的数字
2.8T 总参、50B 激活,这个激活比(1.8%)比 DeepSeek V4-Pro 更极端——你在内存里放着全量 2.8T 参数,但每次推理只用到 1.8% 的计算量。
896 选 16,相当于每个 token 有 896 个专家可以选。对比典型的 MoE 设计(8 experts 选 2、64 选 8),K3 的 expert 池大了一个量级。这意味着理论上的专家分工可以更细——可能有专门的数学专家、代码专家、文学专家、中文专家……
当然,大 expert 池也意味着路由器的压力更大——如何在 896 个选项中每次都准确挑出最相关的 16 个,是 K3 隐藏的、也是最容易被忽视的技术难点。
三、架构创新:Kimi Delta Attention
这是 K3 最值得关注的技术部分。
标准注意力的瓶颈
在大模型中,KV Cache 是长上下文推理的头号敌人:
- 上下文长度每翻倍,KV Cache 翻倍
- 以 80 层、每层 64 个 KV head、head dim 128 估算,1M 上下文的 KV Cache(FP16)约需 80 × 64 × 128 × 1M × 2 bytes ≈ 1.3TB 显存
- 这意味着一块 H100(80GB)连 cache 的零头都装不下,更别说做推理了
KDA 如何解决
Kimi Delta Attention 是 Kimi Linear 架构(arXiv:2510.26692)的核心创新。它属于线性注意力(linear attention) 的一种变体,将标准 Attention 的 O(n²) 复杂度降为 O(n)。
具体来说,KDA 扩展了 Gated DeltaNet 架构,通过细粒度通道级门控(fine-grained channel-wise gating)——每个特征维度拥有独立的遗忘率,使得有限状态 RNN 记忆体可以更精确地控制上下文保留与否。配合 3:1 的混合架构(每 3 层 KDA 穿插 1 层标准 MLA),在长上下文场景下大幅降低了 KV Cache 的存储需求。
KDA 的关键公式:
- 状态更新:Sₜ = (I - βₜkₜkₜᵀ) Diag(αₜ) Sₜ₋₁ + βₜkₜvₜᵀ
- 其中 αₜ 是细粒度遗忘门,βₜ 是更新门
官方宣称的效果:
- KV Cache 减少 12.5 倍——1M 上下文的 KV Cache ≈ 标准 MHA 下 80K 的大小
- 解码速度提升 6.3 倍——主要是 cache 变小后,memory-bound 程度大幅降低
横向对比
| 模型 | 最大上下文 | 注意力架构 |
|---|---|---|
| Kimi K3 | 1M | Kimi Delta Attention(论文已发表,kernel 已开源) |
| Gemini 3.1 Ultra | 2M | 推测为线性注意力变体 |
| DeepSeek V4-Pro | 1M | MLA + Compressed Sparse Attention 混合架构 |
| Claude Fable 5 | 200K | 标准 attention |
| GPT-5.6 Sol | 256K | — |
K3 的 1M 是实测有效的——上下文越长,KDA 的优势越明显。如果 KDA 在实际使用中表现稳定,这可能是未来注意力架构的一个重要方向。
关于 KDA 的开源状态: KDA 的论文 Kimi Linear: An Expressive, Efficient Attention Architecture(arXiv:2510.26692)于 2025 年 10 月已发表,Moonshot 也开源了 KDA 的 kernel 和 vLLM 实现(GitHub 上有 Triton/CUDA 版本)。甚至 Kimi Linear 3B/48B 的实验模型权重也已放出。所以 KDA 并非"黑盒"——从论文到代码都是公开的。不过 K3 具体如何将 KDA 与 2.8T MoE 集成的细节,要等 7 月 27 日权重发布后才能验证。
四、MoE 设计:896 专家如何分工?
参数规模级联
K3 的 MoE 配置是"宽而浅"的——很宽的 expert 池(896 个),但每层只选 16 个:
模型 Expert 配置 参数激活比(激活参/总参)
Kimi K3 896 × 16 active 1.8% (50B/2.8T)
DeepSeek V4-Pro 384+1 共享 × 6 active ~3% (49B/1.6T)
GLM-5.2 256+1 共享 × 8 active ~5.4% (40B/744B)
Llama 4 Maverick 128+1 共享 × 1+1 共享 ~4.3% (17B/400B)
Qwen3.5-A17B 512+1 共享 × 10 active ~4.3% (17B/397B)
注意:这里的"激活比"指的是参数激活比(激活参数量 / 总参数量),不是专家选择比(active experts / total experts)。两者数值通常不同——例如 GLM-5.2 的参数激活比是 5.4%,但专家选择比只有 8/257≈3.1%。K3 的 1.8% 在两者上刚好巧合相等。
K3 的参数激活比(1.8%)在所有主流 MoE 中是最低的。这意味着 K3 的"计算效率"表面上看更高——每 token 只需动用更小比例的参数。但是:
更大的 total params + 更小的 active ratio = 更贵的部署成本。
- 2.8T 参数的 FP16 权重 ≈ 5.6TB
- Q4 量化后 ≈ 1.5TB
- 即使只激活 50B,你也得先把 2.8T 参数(量化后 1.5TB)装进内存
Moonshot 没有公布单卡推理需求,但一个合理的猜测是:K3 最低也需要多卡才能跑起来,不是一张 H100 能搞定的事。
MoE 规模对比表
| 模型 | 总参 | 激活参 | Experts | Active/token | 磁盘 (Q4) |
|---|---|---|---|---|---|
| Kimi K3 | 2.8T | ~50B | 896 | 16 | ~1.5TB |
| DeepSeek V4-Pro | 1.6T | ~49B | 384+1 共享 | 6 | ~800GB |
| Llama 4 Maverick | ~400B | ~17B | 128+1 共享 | 1+1(共享) | ~200GB |
| GLM-5.2 | 744B | ~40B | 256+1 共享 | 8 | ~400GB |
| Qwen3.5-397B-A17B | 397B | 17B | 512+1 共享 | 10 | ~200GB |
| Kimi K2.7 Code (前代) | 1T | ~32B | 640 | 8 | ~500GB |
从这张表可以清楚看到 MoE 设计的两个分化方向:
- 高端旗舰(K3、DeepSeek V4-Pro、GLM-5.2):激活参数 40-50B,面向最强能力
- 高效开源(Llama 4 Maverick、Qwen3.5-A17B):激活参数 ~17B,面向可部署性
K3 的 2.8T 总参意味着它对内存带宽的需求极高——虽然只激活 ~50B 参数,但必须先装下 2.8T 的所有权重(Q4 量化后 ~1.5TB)。这决定了 K3 不可能在单卡上运行。
五、评测表现:全球第三,差在哪、好在哪?
综合排名
根据 Artificial Analysis Intelligence Index v4.1——一个聚合多个评测维度的综合指数:
| 排名 | 模型 | AA Index |
|---|---|---|
| 🥇 | Claude Fable 5 | 60 |
| 🥇 | GPT-5.6 Sol | 59 |
| 🥉 | Kimi K3 | 57 |
| 4 | Claude Opus 4.8 | 56 |
| 5 | GPT-5.5 | 55 |
| 6 | Gemini 3.1 Ultra | — (未公布完整分数) |
| 7 | DeepSeek V4-Pro | — |
K3 排名全球第三,与 Opus 4.8 和 GPT-5.5 处在同一区间,但距离前两名(Fable 5、GPT-5.6 Sol)还有 2-3 分的差距。
详细 Benchmark 对比
| Benchmark | Kimi K3 | GLM-5.2 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| GPQA-Diamond | 93.5 | 91.2 | 90.1 | — | 94.1 |
| BrowseComp | 91.2 🏆 | — | — | 88.0 | 90.4 |
| MMLU-Pro | — | 86.6 | 89.0 | 91.5 | — |
| DeepSWE | 67.5 | 46.2 | — | 70.0 | 73.0 |
| FrontierSWE | 81.2 | 67.3 | — | 86.6 | 71.3 |
| Terminal-Bench 2.1 | 88.3 | 81.0 | — | 84.6 | 88.8 |
| SWE Marathon | 42.0 🏆 | 13.0 | — | — | — |
| Program Bench | 77.8 | — | — | — | 77.6 |
| Frontend Code Arena | 1679 🏆 | — | — | 1631 | — |
| SWE-bench Pro | — | 62.1% | — | — | — |
| AIME 2026 | — | 99.2% | — | — | — |
| MCP-Atlas | — | 77.0% | — | — | — |
| AA Intelligence Index | 57 | 51 | — | 60 | 59 |
注: “—” 表示该模型在此 Benchmar 上未公开分数,不代表能力高低。不同模型的评测设置(temperature、few-shot、scaffold)可能不同,直接对比需谨慎。
逐项分析
BrowseComp 91.2——真·SOTA
这是 K3 最亮眼的成绩。BrowseComp 是一个需要结合多步网页浏览 + 推理的复杂评测,比简单的 QA 要难得多。
91.2 分超过了 GPT-5.6 Sol(90.4)和 Claude Fable 5(88.0)。这里要注意两个细节:
- GPT-5.6 Sol 在测试时开启了 cyberguards(安全限制),可能影响了它在某些搜索任务上的表现
- Claude Fable 5 在浏览类任务中有 potential fallbacks(默认回答策略)
但即使扣除这些因素,K3 的 BrowseComp 成绩也确实在顶级水平。
GPQA-Diamond 93.5——接近天花板
GPQA 是博士级科学推理测试(物理、化学、生物)。K3 的 93.5 分和 GPT-5.6 Sol(94.1)差距极小,大幅超越了 GLM-5.2(91.2)。
这个分数已经很高了——去年 GPT-5.5 在这个测试上也就 93.5。
DeepSWE 67.5——编码的短板?
DeepSWE 是当前最强的代码修复评测之一。K3 的 67.5 分落后于 Claude Fable 5(70.0)和 GPT-5.6 Sol(73.0),但大幅领先 GLM-5.2 的 46.2(+21.3 分)。
但 K3 在其他编码测试上表现亮眼:
- FrontierSWE 81.2:超越 GPT-5.6 Sol(71.3)和 GLM-5.2(67.3),仅次于 Fable 5(86.6)
- Frontend Code Arena 1679:超越 Fable 5(1631)
- SWE Marathon 42.0:GLM-5.2 只有 13.0,差距拉大到 3 倍
- Terminal-Bench 2.1 88.3:仅以 0.5 分惜败 GPT-5.6 Sol(88.8),领先 GLM-5.2(81.0)
这说明不同编码测试侧重点完全不同:
- DeepSWE 侧重从头修复复杂代码仓库中的 bug——需要理解整个代码库的上下文
- Program Bench 侧重从指令生成完整函数——代码生成能力和指令遵循能力
- FrontierSWE 侧重前沿代码工程能力
- SWE Marathon 侧重超长周期代码任务(构建编译器、优化 kernel 等)
K3 在 DeepSWE 上落后于 Fable 5 和 GPT-5.6 Sol,但在更多编码维度上展现了一流水平。可以说它的编码能力是偏科但不弱——在长周期自治编码上甚至是最强的。
六、K3 vs GLM-5.2:最直接的国产旗舰对决
如果把 K3 和 GLM-5.2 单独拎出来对比——两者都是中国团队出品、都是 MoE、都在 2026 年中发布、都承诺开放权重——它们其实是目前国产模型中最直接的对手。
架构差异
| 项目 | Kimi K3 | GLM-5.2 |
|---|---|---|
| 总参数量 | 2.8T | 744B |
| 激活参数量 | ~50B | ~40B |
| Experts | 896 | 256+1 共享 |
| Active/token | 16 | 8 |
| 注意力架构 | Kimi Delta Attention | Sparse Attention + IndexShare |
| 上下文 | 1M | 1M |
| 推理速度 | ~37 tok/s | ~133 tok/s |
| API 价格(输出) | ~$15/M tok | ~$4.40/M tok |
| 开放协议 | 修改版 MIT(7月27日) | MIT(已开放) |
从架构上看,K3 是规模路线(2.8T 总参 × 896 专家),GLM-5.2 是效率路线(744B 总参 × 256 专家 + IndexShare 优化)。两者激活参数量只差 10B,但总参差了 3.8 倍。
评测全方位对比
以下是双方已公开的所有评测数据——标注了每个分数是否是模型方正式公布的:
| Benchmark | Kimi K3 | GLM-5.2 | 数据状态 |
|---|---|---|---|
| GPQA-Diamond | 93.5 | 91.2 | ✅ 双方均已公布 |
| BrowseComp | 91.2 🏆 | — | ⚠️ 仅 K3 公布,GLM-5.2 未公布 |
| DeepSWE | 67.5 🏆 | 46.2 | ✅ 双方均已公布 |
| FrontierSWE | 81.2 🏆 | 67.3 | ✅ 双方均已公布 |
| Terminal-Bench 2.1 | 88.3 🏆 | 81.0 | ✅ 双方均已公布 |
| SWE Marathon | 42.0 🏆 | 13.0 | ✅ 双方均已公布 |
| SWE-bench Pro | — | 62.1% 🏆 | ⚠️ 仅 GLM-5.2 公布 |
| AIME 2026 | — | 99.2% 🏆 | ⚠️ 仅 GLM-5.2 公布 |
| MCP-Atlas | — | 77.0% 🏆 | ⚠️ 仅 GLM-5.2 公布 |
| HLE (w/ tools) | — | 54.7% 🏆 | ⚠️ 仅 GLM-5.2 公布 |
| AA Intelligence Index | 57 🏆 | 51 | ✅ 双方均被收录 |
关于"数据状态": “—” 不代表模型做不了,只是模型方没有公布这个分数。某些评测(如 AIME、MCP-Atlas)可能 GLM-5.2 测了而 K3 没测,反之 BrowseComp 只有 K3 公布了。最公平的对比要看双方都公布的 Benchmark。
双方都公布的 Benchmark:K3 全胜
当只看 K3 和 GLM-5.2 都公布了分数的测试,结果是 K3 五项全胜:
| Benchmark | 胜者 | 领先幅度 |
|---|---|---|
| GPQA-Diamond | K3 🏆 | +2.3(93.5 vs 91.2) |
| DeepSWE | K3 🏆 | +21.3(67.5 vs 46.2)🚀 |
| FrontierSWE | K3 🏆 | +13.9(81.2 vs 67.3) |
| Terminal-Bench 2.1 | K3 🏆 | +7.3(88.3 vs 81.0) |
| SWE Marathon | K3 🏆 | +29.0(42.0 vs 13.0)🚀 |
| AA Intelligence Index | K3 🏆 | +6(57 vs 51) |
但 GLM-5.2 也有自己的战场
GLM-5.2 虽然在这些对比测试中落后,但在它独自公布了分数的几个评测上展现了特定领域的强势:
- SWE-bench Pro 62.1%——开放权重模型中的最高分,甚至超过了 GPT-5.5(58.6%)
- AIME 2026 99.2%——几乎满分的竞赛数学,说明 GLM-5.2 的推理能力极强
- MCP-Atlas 77.0%——工具调用能力接近 Claude Opus 4.8(77.8%)
而且 GLM-5.2 已有 MIT 协议开放权重、推理速度是 K3 的 3.6 倍、价格只有 K3 的 1/3。如果从"实际可用性"角度,GLM-5.2 的实用价值并不低。
结论:两种路线,两种选择
能力上限 实用部署
Kimi K3 ◄━━━━━━━━━━━━━━━━━━━━━━━━━━► GLM-5.2
│ │
更强评测分数 更快更便宜
更大参数量 已开源可用
BrowseComp SOTA SWE-bench Pro #1 开源
两者不是"谁完全取代谁"的关系。如果只看评测天花板,K3 明显更强;如果看"明天就能部署上线",GLM-5.2 的成熟度和性价比更高。
七、整体定位:K3 在行业格局中的位置
从 K2 到 K3:一年的进化
| 指标 | K2 (2025.7) | K2.5 | K2.6 | K2.7 Code (2026.6) | K3 (2026.7) |
|---|---|---|---|---|---|
| 总参 | 1T | 1T | 1T | 1T | 2.8T |
| 激活 | ~30B | ~30B | ~30B | ~32B | ~50B |
| Experts | 640 | 640 | 640 | 640 | 896 |
| Active/token | 8 | 8 | 8 | 8 | 16 |
| 专注方向 | 通用 | 通用 | 通用 | 编码/Agent | 通用旗舰 |
| AA-Briefcase Elo | — | — | 816 | — | 1543 🚀 |
| 上下文 | 128K | 256K | 256K | 256K | 1M |
| 开源 | ✅ 开放权重 | ✅ | ✅ | ✅ | 承诺开放 |
从 K2 到 K2.6 是在 1T 规模上的小步迭代(优化训练、改进数据、扩大上下文)。K2.7 Code 在 2026 年 6 月作为编码特化版本出现,保留了 1T 规模但优化了 Agent 和代码生成能力。K3 则是一次全栈升级——参数规模 2.8 倍、Expert 池扩大 40%、上下文 4 倍、架构引入 KDA。
AA-Briefcase Elo 从 816 跃升到 1543(+727 分),分数翻倍,说明 K3 在 Agent 能力上有质的飞跃。
在全球格局中的位置
能力梯队(基于综合评测)
├── 第一梯队:Claude Fable 5 / GPT-5.6 Sol
├── 第二梯队:Kimi K3 / Claude Opus 4.8 / GPT-5.5
├── 第三梯队:GLM-5.2 / DeepSeek V4-Pro / Gemini 3.1 Ultra
└── 第四梯队:Llama 4 Maverick / Qwen3.5-397B / 其他开源
K3 卡在第二梯队头部,距离第一梯队还有一点距离,但这个距离正在缩小——一年前 K2.5 和 GPT-5.5 的差距更大。
八、开源的意义
7 月 27 日:一个值得被记住的日子
Moonshot 承诺在 2026 年 7 月 27 日前开放 K3 的完整模型权重,使用修改版 MIT 协议。
如果按时兑现,这将是:
- 首个 3T 级开放权重模型
- 目前最大开放权重模型的记录保持者(之前是 GLM-5.2 的 744B)
- 首次有中国团队在模型规模上做到"最大 + 开放"的双重第一
"开源"的实际含义
这里的"开源"准确说应该是 open-weight release:
- ✅ 开放模型权重(修改版 MIT 协议——商业可用)
- ❌ 不开放训练数据
- ❌ 不开放训练代码
- ❌ 不开放数据处理流程
在大模型行业,这已经是"开源"的默认含义了。从 Llama 到 DeepSeek,都是走的这条路。
谁跑得动?
2.8T 参数即使经过 Q4 量化,也需要约 1.5TB 存储空间——单张 H100(80GB)远远不够。按纯权重加载计算,至少需要 19 张 H100;如果使用更激进的量化(如 MXFP4 原生格式)或 CPU offloading,需求可能降低,但多卡部署是确定无疑的。
所以这个"开源"的目标用户不是开发者在自己电脑上玩,而是:
- 云服务商:部署 API 服务
- 企业和机构:私有化部署
- 研究者:分析模型行为、微调适配
但即便如此,K3 的开放也是一个信号——模型规模的竞赛还在继续,而且 Moonshot 选择用"开放"作为竞争的武器。
九、未解的问题
这次调研中有几个问题没有得到答案:
1. 训练数据是什么?
官方博客和所有二级来源都没有提及训练数据的规模、来源、配比。K3 的知识截止日期、数据去重策略、多语言数据比例——全部未知。
2. 推理成本到底多高?
KDA 声称 6.3× 解码加速和 12.5× KV Cache 压缩,但缺少具体的 tokens/s 数据。在什么硬件上跑?最低需要多少显存?目前都是空白。
3. 长上下文实际表现如何?
1M 上下文 + 896 专家路由 + 稀疏激活,这个组合在实际任务中稳定性如何?长序列下路由器的表现会不会退化?Needle-in-a-Haystack 的具体分数?
4. K3 的训练方法论文什么时候出?
KDA 的论文(Kimi Linear, arXiv:2510.26692)已于 2025 年 10 月发表,kernel 和 vLLM 实现也已开源。但 K3 的训练方案、数据配比、后训练(SFT/RL)流程——这些目前还没有论文。权重虽然 7 月 27 日会发布,但训练细节是否同步公开仍不明确。
十、总结
Kimi K3 是 2026 年下半年最重要的模型发布之一。它证明了几件事:
第一,MoE 的规模还能往上走。 一年前 1T 参数看似很大,今天 2.8T 出现了。MoE 的天花板远没到。
第二,架构创新比堆参数更有价值。 KDA 才是 K3 真正的亮点——12.5 倍 KV Cache 压缩、6.3 倍解码加速,这些数字如果能复现,会改变长上下文推理的游戏规则。
第三,中国团队在开放模型上开始领先。 K3 是目前明确承诺开放的最大模型。如果 Moonshot 兑现承诺,他们在"开放"这件事上的执行力和魄力超过了 Meta 和 DeepSeek。
第四,距离第一梯队还有一步之遥。 BrowseComp 拿了 SOTA、GPQA 接近满分,但 DeepSWE 编码评测落后于 Fable 5 和 GPT-5.6 Sol。综合来看,K3 不是最强,但已经是最强候选之一。
最后,回到最实际的问题:K3 对你我意味着什么?
- 如果你用 API 做应用,7 月 27 日后可以关注 K3 的价格和效果
- 如果你做模型研究,KDA 和 Attention Residuals 值得深入看(论文和代码已开源,但 K3 的训练细节待权重发布后验证)
- 如果你是开源爱好者,这是目前规模最大的开放权重模型
- 如果你只是想看热闹——2.8T 参数、896 专家、100 万上下文——这些数字本身就是谈资
调研日期:2026-07-23 | 信息来源:Moonshot AI 官方博客、Artificial Analysis、VentureBeat、Digital Trends、BBC、Bloomberg 等
更多推荐
所有评论(0)