7月16日,月之暗面丢出 Kimi K3,马斯克在 X 上留了一句"Impressive"。
11天后,7月27日零点,完整 2.8 万亿权重在 Hugging Face 以 Modified MIT 协议全量放出。
海外分析师说它像"火星落进充满汽油的房间",美国电视台甚至把它称作带崩美股的原因之一。

对真要拿 AI 干活的人来说,这些宏大叙事都不重要。重要的问题只有一个:它到底能不能替我把活干了?

下边不堆参数,也不背跑分,挑干的聊。


一、先说清楚,Kimi K3 是什么

月之暗面这回掏出来的,是目前参数最大、综合能力最强的旗舰大模型,也是全球首个迈入 3T 级别的开源模型

不是 K2 那种小修小补,直接跳了一级。3T 级意味着什么?意味着开源模型第一次摸到了此前只有顶尖闭源才敢想的参数天花板。说白了,就是开源头一回够着了闭源那帮人守的门槛。
在这里插入图片描述

注意,"开源"这个词,在 7 月 27 日之前和之后,含义完全不同。这点后面细说。


二、2.8万亿参数,听着吓人

2.8万亿。什么概念?目前全球参数规模最大的开源模型,没有之一。

参数大,不等于每次都全量调用。K3 用的是 Stable Latent MoE(混合专家)稀疏架构–一共 896 个专家,每次推理只动态激活 16 个。

打个比方:它脑子里装了 896 个"专科医生",你问什么病,它只请最对口的 16 位来会诊。知识容量撑到顶,算力开销却控制得很死。对比上一代 K2(1 万亿参数、每次激活 320 亿),K3 体量翻了近 3 倍,激活反而更精细了。

让它"想得更深"靠的是三招自研结构改动:

  • Kimi Delta Attention(KDA):混合线性注意力,专门解决长文本"读到后面忘前面"的问题。
  • Attention Residuals(AttnRes):让信息在深层网络里传得更顺,不衰减。
  • 还有 Moon Clip,一个全新的二阶优化器,训练效率直接拉满。

三者合力,让 K3 相比 K2 整体扩展效率提升约 2.5 倍。官方咬死说是底层原创、不是蒸馏谁的。说人话就是:别管外头怎么传,这套是自己一笔一笔攒出来的–蒸馏那档子事,后头单聊。


三、100万 Token 上下文,能装下什么

最高支持 100 万 Token 上下文,约等于一次性"记住"750 页 PDF。

这个数字真正值钱的地方不在"能记住多少",在它改了你的工作方式:

  • 把整本《深入理解 Linux 内核》+ 全部注释 + 调试日志 + 项目 README + Git 历史,一次性丢给它找 Bug;
  • 让它同时读 5 份竞品的行业研报,交叉比对得出结论;
  • 把一个几千个文件的大型代码仓库整体喂进去,问它"这个架构为什么这么设计";
  • 或者跑多步骤 Agent 工作流,中途上下文一个不丢。

话说回来,“支持 100 万"不等于"默认就能用到 100 万”。部分套餐和第三方工具的默认上下文会更短,开发者得手动把 context-window 设成 1048576 才能调满。这 100 万基本是摆设–杀鸡用牛刀,刀是真刀,鸡用不上。它值钱的地方在大型项目和长文档,别拿它当普通聊天框使。


四、前端编程全球第一,水分大不大

K3 敢吹的就是这块,也是该拿放大镜看的地方。

评测机构 Artificial Analysis 的数据:K3 以 1679 分登顶 Frontend Code Arena,前端代码生成全球第一,7 个前端领域里 6 个排第一。
在这里插入图片描述

其他几项硬指标:

基准测试 Kimi K3 对比
Terminal Bench 2.1 88.3 接近 GPT-5.6 Sol
Program Bench 77.8 超过 Claude Opus 4.8
BrowseComp 91.2 表现突出
综合智能指数 仍落后 Claude Fable 5、GPT-5.6 Sol

看着是挺猛。不过跑分跟干活,两码事。

有人花了 5 亿 Token、开了 699 元最高档会员,让 K3 和 GPT-5.6 Sol(Codex)同题从零复刻《GTA5》网页游戏。结果有点意外:K3 耗时几小时、Codex 半小时就交了差。可 K3 做出来的版本细节更丰富–驾驶、碰撞、警察追捕(连直升机探照灯搜索玩家都有),体验上压过了 Codex。说白了,一个图快一个图细,这回细的那个赢了。

K3 这回是真的"会看"了。它写完代码会自己打开网页、截图、观察视觉效果再调整,这个闭环叫 Vision in the Loop。以前 AI 写网页是闭着眼瞎写,这回算是睁开了。

翻车也在这儿。同一位测试者让 K3 看视频复刻《滚动的天空》,它没成功。把视频拆成一帧帧图片去理解,偏差放大,关卡没复刻完整。给 Agent 设计一个剪辑软件,也还得大量人工介入。惊艳归惊艳,翻车也是真翻,抽卡问题还在那儿。

说到底,前端编程它确实能争第一。"全面超越 GPT"这种话嘛,现在说还早。


五、这笔账得掰开算

输入 $3、输出 $15,每百万 Token 一算。

光看这个数,不便宜。编程场景有个杀手锏–缓存命中率超 90%,实际输入成本约只有标准价的 1/4。反复读同一个代码仓库时,能省一大笔。
在这里插入图片描述

争议得拉出来横向比才知道。拿缓存命中价和 DeepSeek V4 比:

场景 DeepSeek V4 Pro Kimi K3 倍数
缓存命中 8M Token 0.2 元 17 元 约 84 倍

是的,缓存命中价 K3 是 DeepSeek 的近 100 倍。订阅制下,K3 单任务成本约为 GPT-5.6 Sol 的两倍;699 元会员跑 4-5 个复杂任务,额度就烧掉 40%。

官方态度倒是很明确:做出了 SOTA 级的模型,就该匹配合理的商业定价,不愿被贴"国产就得便宜"的标签。

那到底贵不贵?这事得看你怎么算。贵一点的模型要是能一次做对,算下来可能比便宜却得反复返工的还省。API 单价只是成本的一部分。


六、7月27日到底放了什么

这事儿最容易误解,得掰开说。

7月16日发布时,K3 叫"开放模型",完整权重没放,你只能用网页端、Kimi Code 和 API。

7月27日零点(UTC),完整 2.8 万亿权重在 Hugging Face 以 Modified MIT 协议全量开源,技术报告同步发布,架构、训练方法、评测细节全部公开。

高校、企业这回能拿到权重做二次微调和私有化部署了,不用再单靠 API。

真想本地跑的话?完整权重需要约 1.4TB 显存。这个门槛高到绝大多数人直接劝退。本地部署?基本是少数巨头的游戏。普通人还是走 API 或第三方推理靠谱。
在这里插入图片描述


七、别光看吹的/它还干不了这些

几条实打实的边界,比跑分更能说明问题:

  1. 官方跑分还没被第三方稳定复现,高推理档位下的成绩不等于日常体验。
  2. 100 万上下文的信息召回是否可靠,长文档里关键细节会不会丢,仍需验证。
  3. 速度是真要命:高峰期输出就几十 token/s,你盯着它转圈,一个任务等 40 分钟是常态,7月19日还因算力过载暂停过部分服务。
  4. 复杂任务照样得人盯着:它能生成软件,可软件"为什么该这么设计",它还没整明白。
  5. 长视频理解也差口气。逐帧拆开去理解,干视频复刻这类活效果直接打折。

八、值不值得/看你拿来干嘛

需要处理大型项目、长文档、多模态编程,或者跑 Agent 工作流?K3 已经值得进实测名单了。闭环挺完整,能看能写能测能调,不怎么用频繁切工具,几项能力都排在第一梯队。

日常就简单问答、短文案、偶尔写段代码的话,K2.6 或 K2.7 Code 反而更划算。别见着新的就上头,新和大不等于处处都值。

撇开跑分,有句话倒是真能改变判断:一次把活干完的模型,哪怕贵点,也比反复返工的省钱。

K3 开了个好头。离真正的"AI 软件工程师"?还有段路要走。这个转变才刚刚开始。


常见问题

Q:Kimi K3 免费能用吗?
可以通过 Kimi 网页端体验,具体额度看账户和订阅方案;API 按输入、输出和缓存 Token 计费。

Q:完整权重开源了吗?
开源了。7月27日 UTC 零点在 Hugging Face 以 Modified MIT 协议放出完整 2.8T 权重和技术报告。

Q:能本地部署吗?
理论上行,就是 1.4TB 显存这个门槛摆在那,绝大多数人还是走 API 或第三方推理。

Q:和 K2.7 Code 怎么选?
复杂项目、超长上下文、多模态编程选 K3;常规代码补全、对速度敏感选 K2.7 Code。

Q:真的超过 GPT 了吗?
前端编程能争第一,综合智能还是被 Claude Fable 5 和 GPT-5.6 Sol 压着。"全面超越"这话说早了。

更多推荐