副标题: 2026 年 7 月 16 日,Moonshot AI 发布了 Kimi K3——2.8 万亿参数的 MoE 巨兽、896 专家、100 万 token 上下文、承诺 7 月 27 日前开源。它是"最强国产模型"吗?和 Claude Fable 5、GPT-5.6 Sol 比处在什么位置?本文做一次全面的技术调研。


一、K3 是什么来头?

2026 年 7 月 16 日,Moonshot AI 发布了他们的最新旗舰模型 Kimi K3。

这条消息在 AI 圈引发了一轮不小的震动,因为几个数字足够震撼:

  • 2.8 万亿参数——比同为 MoE 的 DeepSeek V4-Pro(1.6T)大 75%
  • 896 个 Expert——每 token 激活 16 个
  • 100 万 token 上下文——行业第二,仅次于 Gemini 3.1 Ultra 的 2M
  • 7 月 27 日前开源权重——可能成为首个 3T 级开放权重模型

而且,这不仅仅是"大"。Moonshot 在这代引入了在论文和代码上均已开源的全新注意力架构 Kimi Delta Attention(KDA),号称 KV Cache 压缩 12.5 倍、解码速度提升 6.3 倍。

K2(2025 年 7 月)→ K2.5 → K2.6 → K2.7 Code(2026 年 6 月)→ K3(2026 年 7 月),一年时间,Moonshot 完成了一次跃迁。


二、硬核规格:K3 的核心数字

核心参数总览

项目数值
总参数量2.8 万亿 (2.8T)
架构稀疏 MoE
Expert 数量896
每 token 激活16 个 Expert
激活参数量~50B
激活比~1.8%(激活 50B / 总参 2.8T)
上下文窗口100 万 token
多模态原生视觉能力
关键创新Kimi Delta Attention + Attention Residuals
开放计划2026-07-27 前开放权重(修改版 MIT 协议)

几组值得玩味的数字

2.8T 总参、50B 激活,这个激活比(1.8%)比 DeepSeek V4-Pro 更极端——你在内存里放着全量 2.8T 参数,但每次推理只用到 1.8% 的计算量。

896 选 16,相当于每个 token 有 896 个专家可以选。对比典型的 MoE 设计(8 experts 选 2、64 选 8),K3 的 expert 池大了一个量级。这意味着理论上的专家分工可以更细——可能有专门的数学专家、代码专家、文学专家、中文专家……

当然,大 expert 池也意味着路由器的压力更大——如何在 896 个选项中每次都准确挑出最相关的 16 个,是 K3 隐藏的、也是最容易被忽视的技术难点。


三、架构创新:Kimi Delta Attention

这是 K3 最值得关注的技术部分。

标准注意力的瓶颈

在大模型中,KV Cache 是长上下文推理的头号敌人:

  • 上下文长度每翻倍,KV Cache 翻倍
  • 以 80 层、每层 64 个 KV head、head dim 128 估算,1M 上下文的 KV Cache(FP16)约需 80 × 64 × 128 × 1M × 2 bytes ≈ 1.3TB 显存
  • 这意味着一块 H100(80GB)连 cache 的零头都装不下,更别说做推理了

KDA 如何解决

Kimi Delta Attention 是 Kimi Linear 架构(arXiv:2510.26692)的核心创新。它属于线性注意力(linear attention) 的一种变体,将标准 Attention 的 O(n²) 复杂度降为 O(n)。

具体来说,KDA 扩展了 Gated DeltaNet 架构,通过细粒度通道级门控(fine-grained channel-wise gating)——每个特征维度拥有独立的遗忘率,使得有限状态 RNN 记忆体可以更精确地控制上下文保留与否。配合 3:1 的混合架构(每 3 层 KDA 穿插 1 层标准 MLA),在长上下文场景下大幅降低了 KV Cache 的存储需求。

KDA 的关键公式:

  • 状态更新:Sₜ = (I - βₜkₜkₜᵀ) Diag(αₜ) Sₜ₋₁ + βₜkₜvₜᵀ
  • 其中 αₜ 是细粒度遗忘门,βₜ 是更新门

官方宣称的效果:

  • KV Cache 减少 12.5 倍——1M 上下文的 KV Cache ≈ 标准 MHA 下 80K 的大小
  • 解码速度提升 6.3 倍——主要是 cache 变小后,memory-bound 程度大幅降低

横向对比

模型最大上下文注意力架构
Kimi K31MKimi Delta Attention(论文已发表,kernel 已开源)
Gemini 3.1 Ultra2M推测为线性注意力变体
DeepSeek V4-Pro1MMLA + Compressed Sparse Attention 混合架构
Claude Fable 5200K标准 attention
GPT-5.6 Sol256K

K3 的 1M 是实测有效的——上下文越长,KDA 的优势越明显。如果 KDA 在实际使用中表现稳定,这可能是未来注意力架构的一个重要方向。

关于 KDA 的开源状态: KDA 的论文 Kimi Linear: An Expressive, Efficient Attention Architecture(arXiv:2510.26692)于 2025 年 10 月已发表,Moonshot 也开源了 KDA 的 kernel 和 vLLM 实现(GitHub 上有 Triton/CUDA 版本)。甚至 Kimi Linear 3B/48B 的实验模型权重也已放出。所以 KDA 并非"黑盒"——从论文到代码都是公开的。不过 K3 具体如何将 KDA 与 2.8T MoE 集成的细节,要等 7 月 27 日权重发布后才能验证。


四、MoE 设计:896 专家如何分工?

参数规模级联

K3 的 MoE 配置是"宽而浅"的——很宽的 expert 池(896 个),但每层只选 16 个:

模型            Expert 配置              参数激活比(激活参/总参)
Kimi K3        896 × 16 active          1.8%  (50B/2.8T)
DeepSeek V4-Pro 384+1 共享 × 6 active   ~3%   (49B/1.6T)
GLM-5.2        256+1 共享 × 8 active    ~5.4% (40B/744B)
Llama 4 Maverick 128+1 共享 × 1+1 共享  ~4.3% (17B/400B)
Qwen3.5-A17B   512+1 共享 × 10 active   ~4.3% (17B/397B)

注意:这里的"激活比"指的是参数激活比(激活参数量 / 总参数量),不是专家选择比(active experts / total experts)。两者数值通常不同——例如 GLM-5.2 的参数激活比是 5.4%,但专家选择比只有 8/257≈3.1%。K3 的 1.8% 在两者上刚好巧合相等。

K3 的参数激活比(1.8%)在所有主流 MoE 中是最低的。这意味着 K3 的"计算效率"表面上看更高——每 token 只需动用更小比例的参数。但是:

更大的 total params + 更小的 active ratio = 更贵的部署成本。

  • 2.8T 参数的 FP16 权重 ≈ 5.6TB
  • Q4 量化后 ≈ 1.5TB
  • 即使只激活 50B,你也得先把 2.8T 参数(量化后 1.5TB)装进内存

Moonshot 没有公布单卡推理需求,但一个合理的猜测是:K3 最低也需要多卡才能跑起来,不是一张 H100 能搞定的事。

MoE 规模对比表

模型总参激活参ExpertsActive/token磁盘 (Q4)
Kimi K32.8T~50B89616~1.5TB
DeepSeek V4-Pro1.6T~49B384+1 共享6~800GB
Llama 4 Maverick~400B~17B128+1 共享1+1(共享)~200GB
GLM-5.2744B~40B256+1 共享8~400GB
Qwen3.5-397B-A17B397B17B512+1 共享10~200GB
Kimi K2.7 Code (前代)1T~32B6408~500GB

从这张表可以清楚看到 MoE 设计的两个分化方向:

  • 高端旗舰(K3、DeepSeek V4-Pro、GLM-5.2):激活参数 40-50B,面向最强能力
  • 高效开源(Llama 4 Maverick、Qwen3.5-A17B):激活参数 ~17B,面向可部署性

K3 的 2.8T 总参意味着它对内存带宽的需求极高——虽然只激活 ~50B 参数,但必须先装下 2.8T 的所有权重(Q4 量化后 ~1.5TB)。这决定了 K3 不可能在单卡上运行。


五、评测表现:全球第三,差在哪、好在哪?

综合排名

根据 Artificial Analysis Intelligence Index v4.1——一个聚合多个评测维度的综合指数:

排名模型AA Index
🥇Claude Fable 560
🥇GPT-5.6 Sol59
🥉Kimi K357
4Claude Opus 4.856
5GPT-5.555
6Gemini 3.1 Ultra— (未公布完整分数)
7DeepSeek V4-Pro

K3 排名全球第三,与 Opus 4.8 和 GPT-5.5 处在同一区间,但距离前两名(Fable 5、GPT-5.6 Sol)还有 2-3 分的差距。

详细 Benchmark 对比

BenchmarkKimi K3GLM-5.2DeepSeek V4-ProClaude Fable 5GPT-5.6 Sol
GPQA-Diamond93.591.290.194.1
BrowseComp91.2 🏆88.090.4
MMLU-Pro86.689.091.5
DeepSWE67.546.270.073.0
FrontierSWE81.267.386.671.3
Terminal-Bench 2.188.381.084.688.8
SWE Marathon42.0 🏆13.0
Program Bench77.877.6
Frontend Code Arena1679 🏆1631
SWE-bench Pro62.1%
AIME 202699.2%
MCP-Atlas77.0%
AA Intelligence Index57516059

注: “—” 表示该模型在此 Benchmar 上未公开分数,不代表能力高低。不同模型的评测设置(temperature、few-shot、scaffold)可能不同,直接对比需谨慎。

逐项分析

BrowseComp 91.2——真·SOTA

这是 K3 最亮眼的成绩。BrowseComp 是一个需要结合多步网页浏览 + 推理的复杂评测,比简单的 QA 要难得多。

91.2 分超过了 GPT-5.6 Sol(90.4)和 Claude Fable 5(88.0)。这里要注意两个细节:

  • GPT-5.6 Sol 在测试时开启了 cyberguards(安全限制),可能影响了它在某些搜索任务上的表现
  • Claude Fable 5 在浏览类任务中有 potential fallbacks(默认回答策略)

但即使扣除这些因素,K3 的 BrowseComp 成绩也确实在顶级水平。

GPQA-Diamond 93.5——接近天花板

GPQA 是博士级科学推理测试(物理、化学、生物)。K3 的 93.5 分和 GPT-5.6 Sol(94.1)差距极小,大幅超越了 GLM-5.2(91.2)。

这个分数已经很高了——去年 GPT-5.5 在这个测试上也就 93.5。

DeepSWE 67.5——编码的短板?

DeepSWE 是当前最强的代码修复评测之一。K3 的 67.5 分落后于 Claude Fable 5(70.0)和 GPT-5.6 Sol(73.0),但大幅领先 GLM-5.2 的 46.2(+21.3 分)。

但 K3 在其他编码测试上表现亮眼:

  • FrontierSWE 81.2:超越 GPT-5.6 Sol(71.3)和 GLM-5.2(67.3),仅次于 Fable 5(86.6)
  • Frontend Code Arena 1679:超越 Fable 5(1631)
  • SWE Marathon 42.0:GLM-5.2 只有 13.0,差距拉大到 3 倍
  • Terminal-Bench 2.1 88.3:仅以 0.5 分惜败 GPT-5.6 Sol(88.8),领先 GLM-5.2(81.0)

这说明不同编码测试侧重点完全不同:

  • DeepSWE 侧重从头修复复杂代码仓库中的 bug——需要理解整个代码库的上下文
  • Program Bench 侧重从指令生成完整函数——代码生成能力和指令遵循能力
  • FrontierSWE 侧重前沿代码工程能力
  • SWE Marathon 侧重超长周期代码任务(构建编译器、优化 kernel 等)

K3 在 DeepSWE 上落后于 Fable 5 和 GPT-5.6 Sol,但在更多编码维度上展现了一流水平。可以说它的编码能力是偏科但不弱——在长周期自治编码上甚至是最强的。


六、K3 vs GLM-5.2:最直接的国产旗舰对决

如果把 K3 和 GLM-5.2 单独拎出来对比——两者都是中国团队出品、都是 MoE、都在 2026 年中发布、都承诺开放权重——它们其实是目前国产模型中最直接的对手。

架构差异

项目Kimi K3GLM-5.2
总参数量2.8T744B
激活参数量~50B~40B
Experts896256+1 共享
Active/token168
注意力架构Kimi Delta AttentionSparse Attention + IndexShare
上下文1M1M
推理速度~37 tok/s~133 tok/s
API 价格(输出)~$15/M tok~$4.40/M tok
开放协议修改版 MIT(7月27日)MIT(已开放)

从架构上看,K3 是规模路线(2.8T 总参 × 896 专家),GLM-5.2 是效率路线(744B 总参 × 256 专家 + IndexShare 优化)。两者激活参数量只差 10B,但总参差了 3.8 倍。

评测全方位对比

以下是双方已公开的所有评测数据——标注了每个分数是否是模型方正式公布的:

BenchmarkKimi K3GLM-5.2数据状态
GPQA-Diamond93.591.2✅ 双方均已公布
BrowseComp91.2 🏆⚠️ 仅 K3 公布,GLM-5.2 未公布
DeepSWE67.5 🏆46.2✅ 双方均已公布
FrontierSWE81.2 🏆67.3✅ 双方均已公布
Terminal-Bench 2.188.3 🏆81.0✅ 双方均已公布
SWE Marathon42.0 🏆13.0✅ 双方均已公布
SWE-bench Pro62.1% 🏆⚠️ 仅 GLM-5.2 公布
AIME 202699.2% 🏆⚠️ 仅 GLM-5.2 公布
MCP-Atlas77.0% 🏆⚠️ 仅 GLM-5.2 公布
HLE (w/ tools)54.7% 🏆⚠️ 仅 GLM-5.2 公布
AA Intelligence Index57 🏆51✅ 双方均被收录

关于"数据状态": “—” 不代表模型做不了,只是模型方没有公布这个分数。某些评测(如 AIME、MCP-Atlas)可能 GLM-5.2 测了而 K3 没测,反之 BrowseComp 只有 K3 公布了。最公平的对比要看双方都公布的 Benchmark。

双方都公布的 Benchmark:K3 全胜

当只看 K3 和 GLM-5.2 都公布了分数的测试,结果是 K3 五项全胜

Benchmark胜者领先幅度
GPQA-DiamondK3 🏆+2.3(93.5 vs 91.2)
DeepSWEK3 🏆+21.3(67.5 vs 46.2)🚀
FrontierSWEK3 🏆+13.9(81.2 vs 67.3)
Terminal-Bench 2.1K3 🏆+7.3(88.3 vs 81.0)
SWE MarathonK3 🏆+29.0(42.0 vs 13.0)🚀
AA Intelligence IndexK3 🏆+6(57 vs 51)

但 GLM-5.2 也有自己的战场

GLM-5.2 虽然在这些对比测试中落后,但在它独自公布了分数的几个评测上展现了特定领域的强势

  • SWE-bench Pro 62.1%——开放权重模型中的最高分,甚至超过了 GPT-5.5(58.6%)
  • AIME 2026 99.2%——几乎满分的竞赛数学,说明 GLM-5.2 的推理能力极强
  • MCP-Atlas 77.0%——工具调用能力接近 Claude Opus 4.8(77.8%)

而且 GLM-5.2 已有 MIT 协议开放权重、推理速度是 K3 的 3.6 倍、价格只有 K3 的 1/3。如果从"实际可用性"角度,GLM-5.2 的实用价值并不低。

结论:两种路线,两种选择

             能力上限                实用部署
Kimi K3  ◄━━━━━━━━━━━━━━━━━━━━━━━━━━►  GLM-5.2
   │                                      │
 更强评测分数                       更快更便宜
 更大参数量                         已开源可用
 BrowseComp SOTA                     SWE-bench Pro #1 开源

两者不是"谁完全取代谁"的关系。如果只看评测天花板,K3 明显更强;如果看"明天就能部署上线",GLM-5.2 的成熟度和性价比更高。


七、整体定位:K3 在行业格局中的位置

从 K2 到 K3:一年的进化

指标K2 (2025.7)K2.5K2.6K2.7 Code (2026.6)K3 (2026.7)
总参1T1T1T1T2.8T
激活~30B~30B~30B~32B~50B
Experts640640640640896
Active/token888816
专注方向通用通用通用编码/Agent通用旗舰
AA-Briefcase Elo8161543 🚀
上下文128K256K256K256K1M
开源✅ 开放权重承诺开放

从 K2 到 K2.6 是在 1T 规模上的小步迭代(优化训练、改进数据、扩大上下文)。K2.7 Code 在 2026 年 6 月作为编码特化版本出现,保留了 1T 规模但优化了 Agent 和代码生成能力。K3 则是一次全栈升级——参数规模 2.8 倍、Expert 池扩大 40%、上下文 4 倍、架构引入 KDA。

AA-Briefcase Elo 从 816 跃升到 1543(+727 分),分数翻倍,说明 K3 在 Agent 能力上有质的飞跃。

在全球格局中的位置

能力梯队(基于综合评测)
├── 第一梯队:Claude Fable 5 / GPT-5.6 Sol
├── 第二梯队:Kimi K3 / Claude Opus 4.8 / GPT-5.5
├── 第三梯队:GLM-5.2 / DeepSeek V4-Pro / Gemini 3.1 Ultra
└── 第四梯队:Llama 4 Maverick / Qwen3.5-397B / 其他开源

K3 卡在第二梯队头部,距离第一梯队还有一点距离,但这个距离正在缩小——一年前 K2.5 和 GPT-5.5 的差距更大。


八、开源的意义

7 月 27 日:一个值得被记住的日子

Moonshot 承诺在 2026 年 7 月 27 日前开放 K3 的完整模型权重,使用修改版 MIT 协议。

如果按时兑现,这将是:

  • 首个 3T 级开放权重模型
  • 目前最大开放权重模型的记录保持者(之前是 GLM-5.2 的 744B)
  • 首次有中国团队在模型规模上做到"最大 + 开放"的双重第一

"开源"的实际含义

这里的"开源"准确说应该是 open-weight release

  • ✅ 开放模型权重(修改版 MIT 协议——商业可用)
  • ❌ 不开放训练数据
  • ❌ 不开放训练代码
  • ❌ 不开放数据处理流程

在大模型行业,这已经是"开源"的默认含义了。从 Llama 到 DeepSeek,都是走的这条路。

谁跑得动?

2.8T 参数即使经过 Q4 量化,也需要约 1.5TB 存储空间——单张 H100(80GB)远远不够。按纯权重加载计算,至少需要 19 张 H100;如果使用更激进的量化(如 MXFP4 原生格式)或 CPU offloading,需求可能降低,但多卡部署是确定无疑的

所以这个"开源"的目标用户不是开发者在自己电脑上玩,而是:

  • 云服务商:部署 API 服务
  • 企业和机构:私有化部署
  • 研究者:分析模型行为、微调适配

但即便如此,K3 的开放也是一个信号——模型规模的竞赛还在继续,而且 Moonshot 选择用"开放"作为竞争的武器。


九、未解的问题

这次调研中有几个问题没有得到答案:

1. 训练数据是什么?
官方博客和所有二级来源都没有提及训练数据的规模、来源、配比。K3 的知识截止日期、数据去重策略、多语言数据比例——全部未知。

2. 推理成本到底多高?
KDA 声称 6.3× 解码加速和 12.5× KV Cache 压缩,但缺少具体的 tokens/s 数据。在什么硬件上跑?最低需要多少显存?目前都是空白。

3. 长上下文实际表现如何?
1M 上下文 + 896 专家路由 + 稀疏激活,这个组合在实际任务中稳定性如何?长序列下路由器的表现会不会退化?Needle-in-a-Haystack 的具体分数?

4. K3 的训练方法论文什么时候出?
KDA 的论文(Kimi Linear, arXiv:2510.26692)已于 2025 年 10 月发表,kernel 和 vLLM 实现也已开源。但 K3 的训练方案、数据配比、后训练(SFT/RL)流程——这些目前还没有论文。权重虽然 7 月 27 日会发布,但训练细节是否同步公开仍不明确。


十、总结

Kimi K3 是 2026 年下半年最重要的模型发布之一。它证明了几件事:

第一,MoE 的规模还能往上走。 一年前 1T 参数看似很大,今天 2.8T 出现了。MoE 的天花板远没到。

第二,架构创新比堆参数更有价值。 KDA 才是 K3 真正的亮点——12.5 倍 KV Cache 压缩、6.3 倍解码加速,这些数字如果能复现,会改变长上下文推理的游戏规则。

第三,中国团队在开放模型上开始领先。 K3 是目前明确承诺开放的最大模型。如果 Moonshot 兑现承诺,他们在"开放"这件事上的执行力和魄力超过了 Meta 和 DeepSeek。

第四,距离第一梯队还有一步之遥。 BrowseComp 拿了 SOTA、GPQA 接近满分,但 DeepSWE 编码评测落后于 Fable 5 和 GPT-5.6 Sol。综合来看,K3 不是最强,但已经是最强候选之一。

最后,回到最实际的问题:K3 对你我意味着什么?

  • 如果你用 API 做应用,7 月 27 日后可以关注 K3 的价格和效果
  • 如果你做模型研究,KDA 和 Attention Residuals 值得深入看(论文和代码已开源,但 K3 的训练细节待权重发布后验证)
  • 如果你是开源爱好者,这是目前规模最大的开放权重模型
  • 如果你只是想看热闹——2.8T 参数、896 专家、100 万上下文——这些数字本身就是谈资

调研日期:2026-07-23 | 信息来源:Moonshot AI 官方博客、Artificial Analysis、VentureBeat、Digital Trends、BBC、Bloomberg 等

更多推荐