Kimi k3 “deepseek 2.0时刻”
Kimi K3是月之暗面公司于2026 年 7 月 17 日正式发布的新一代 AI 大模型,拥有2.8 万亿参数和100 万 token 上下文窗口,是全球参数规模最大的开源模型,已于2026 年 7 月 27 日晚正式开源模型权重与技术报告。

k3的编程能力在 Code Arena 前端编程榜单中以1679 分登顶首位,超过 Claude Fable 5 的 1631 分,这是开源模型第一次在这个维度上反超顶级闭源。
综合能力在 Artificial Analysis Intelligence Index 中获得57 分,位列全球第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol

马斯克也对kimi k3进行了称赞:
紧接着用户量的暴涨,导致算力不足,暂停会员注册,这次的热度被称为deepseek 2.0时刻。

一、核心特点
1. 用更少的计算,承载更大的模型
Kimi K3总参数量达到2.8万亿,但每次推理只调用约1040亿参数。相比所有参数都参与计算的传统稠密模型,它能在扩大知识容量的同时控制计算量。
相较Kimi K2,K3的整体扩展效率提高约2.5倍。这意味着K3的提升不只是“参数更多”,而是能够以更高效率利用这些参数。
2. 从处理长文档升级到处理完整项目
K3支持约100万token上下文,是常见128K模型的近8倍、256K模型的约4倍。
这使它不仅能阅读一篇长文档,还可以同时处理大型代码仓库、多份研究资料和较长的工具调用记录。相比上下文较短的模型,K3在长时间编程和跨文件分析中更不容易遗忘前面的要求。
3. 从“生成代码”升级到“完成工程”
传统代码模型擅长补全函数或生成单个文件,但面对真实项目,往往难以持续完成查看代码、修改文件、运行测试和修复错误的完整流程。
K3更强调长程编程和工具操作。在Terminal-Bench 2.1中,K3取得88.3分,与GPT-5.6 Sol的88.8分接近;在SWE-Marathon中取得42.0分,高于GPT-5.6 Sol的39.0分和Claude Fable 5的35.0分。
因此,K3的主要突破不是“更会写代码”,而是更接近能够独立推进项目的工程智能体。
4. 从“回答问题”升级到“交付成果”
K3能够连续搜索资料、分析数据、运行代码,并最终制作报告、电子表格、网页或演示文稿。
在AA-Briefcase办公任务测试中,K3发布初期取得1543 Elo,排名第二;其分析质量Elo达到1754,略高于Claude Fable 5的1744。不过,K3的演示质量Elo为1471,低于GPT-5.6 Sol的1660,说明它在分析能力上更突出,成果的视觉表达仍有提升空间。
5. 同时理解文字和视觉信息
K3能够直接理解图片、网页截图、图表和设计稿。相比先通过OCR提取文字、再由语言模型分析的传统方案,它可以保留布局、颜色和空间关系。
这让K3在网页复刻、界面操作和视觉编程中更具优势。发布后,K3一度在Arena React代码榜以1694分排名第一,显示出较强的前端生成能力。
总体来看,K3的超越主要集中在长程编程、多文件分析、工具调用和成果交付上,并不意味着它在所有场景中都全面领先。以Arena通用文本榜为例,K3 Max截至2026年7月29日以1486±10分暂列第11名,其优势明显偏向复杂任务而非普通对话。
二、背后的主要技术
传统上,把一个语言模型做大,主要就是堆层数、堆参数。K3 的设计思路更立体,它让信息沿着三个方向同时流动,序列长度、网络深度、模型宽度。你可以把它想象成一栋楼,长度是每层楼有多宽敞,深度是楼有多少层,宽度是每层能同时容纳多少个专业工种。

序列方向上,K3 用了一套混合注意力,把三层 Kimi Delta Attention 配一层 Gated MLA,三比一的比例贯穿整个网络。
深度方向上,一套叫 Attention Residuals 的机制,让每一层都能回头看之前所有层的信息。
宽度方向上,每层注意力后面接一个 Stable LatentMoE,从 896 个专家里每次只挑 16 个干活。
右侧是主干,每个 block 由三层 KDA 加一层 Gated MLA 组成,暗红色的连线就是 AttnRes,让每层能回看之前所有 block。左上是 Stable LatentMoE 的共享专家与路由专家,左下是 KDA 模块,底部是原生视觉通路 MoonViT-V2。
1. KDA 混合线性注意力
Kimi Delta Attention(KDA)用于降低长序列的注意力计算成本。
传统 Softmax 注意力处理 1M 上下文时,KV Cache 会直接撑爆显存。K3 的方案是每个 Block 3 层 KDA + 1 层 Gated MLA:
线性注意力把注意力成本从平方级压到线性级——不必每来一个新 token 就重翻全部历史,只维护一个持续更新的笔记本;KDA 更进一步,给笔记本每一栏配了可学习的遗忘开关,由模型决定哪些需要记住,哪些需要遗忘,Gated MLA(全局注意力)则周期性保留精确的全局检索能力,防止细节丢失
通过"3 层 KDA 线性注意力 +1 层 Gated MLA 全局注意力”的 3:1 组合,将百万级上下文解码速度提升约 6.3 倍。
2. Attention Residuals(注意力残差)
常规的深层网络有个隐忧,信息是一层一层顺着往上传的,传到几十层之后,最底下那层学到的东西,可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后跟原话往往对不上。

注意力残差让网络里每一个模块,都能越过中间所有层,直接回头去调取最初的输入、以及之前任意一个模块的输出。普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了 AttnRes 的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。
AttnRes改善信息在深层网络中的传递,减少模型层数增加后出现的信息损失;Gated MLA通过压缩注意力中的键值信息降低KV缓存占用,并利用门控机制动态控制信息传递。
K3的93层网络中,有69层使用KDA、24层使用Gated MLA,从而兼顾长上下文效率和信息处理精度。
3. Stable LatentMoE 超稀疏 MoE
K3采用Stable LatentMoE混合专家架构,总参数量达到2.8万亿,但每个token仅激活约1040亿参数。模型设置896个专家,每次只选择其中16个参与计算。
相当于把一个巨大的模型拆成很多个专家子网络,每次只唤醒其中几个来处理当前的输入。好比一家 896 人的会诊医院,每个病人只安排 16 个最对口的专家出诊,其他人待命。医院名义规模巨大,但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因,参数量做得极大,但每个 token 实际激活的计算量被控制得很小。
相比所有参数同时参与推理的稠密模型,这种稀疏激活方式既能扩大模型容量,又能控制计算成本。官方称,其整体扩展效率较Kimi K2提升约2.5倍。
4. 原生多模态:MoonViT-V2
K3集成约4.01亿参数的MoonViT-V2视觉编码器,将图片信息转换成模型能够理解的表示,并与文字共同参与推理。
相比“先用OCR识别文字,再交给语言模型”的方案,原生多模态能够保留图片中的布局、颜色和空间关系,因此更适合网页截图复刻、图表分析、界面操作和视觉编程。
总结:K3 的最大意义不在于参数最大,而在于验证了开源模型也可以在超长上下文智能体这个闭源最后的堡垒上掰手腕,让国产模型的优点不再只是便宜。
更多推荐


所有评论(0)