速览

月之暗面(Moonshot AI)于7月17日(X上的发布时间)发布Kimi K3。

昨天我用了一下,感觉还不错,故写文分享一下。我做的事情是优化OBS(开源录屏软件):

  • 实现随意框选区域进行录屏,无需多余操作;
  • 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。

这两天稍微处理一下就发布。

回到 Kimi K3,它是目前全球参数规模最大的开源大模型,参数量达到了 2.8 万亿级别。 1M 上下文窗口 + low / high / max 三档思考深度,擅长复杂工程任务与长程推理,原生多模态

目前国内的几个顶级模型都表现不错:Deespseek、GLM、Qwen、Kimi…,而且都是开源。

简单对比一下:

ChatGPT Image 2026年7月21日 19_35_01
模型 厂商 发布时间 总参数量 专家架构 上下文窗口 模态 开源状态
Kimi K3 月之暗面 07-17 2.8T MoE (激活约50B) 1M 多模态:文本、图像、视频输入,文本输出 计划开源,完整权重预计 2026 年 7 月 27 日前放出
DeepSeek V4 Pro-Preview 深度求索 预览版:04-24
正式版即将发布
1.6T MoE (激活约49B) 1M 纯文本(无多模态) 已开源,MIT 协议
GLM-5.2 智谱AI 06-13 753B MoE (激活约40B) 1M 纯文本(无视觉能力) 已开源,MIT 协议
Qwen3.8-Max-Preview 阿里云 07-19 2.4T MoE (激活参数未公开) 1M 多模态:文本、图像、视频、文档 预览版闭源,正式版计划开源(时间未定)
MiniMax-M3 稀宇科技 06-01 428B MoE (激活约23B) 1M 原生多模态:文本、图像、视频 开源权重

价格对比:

说明:国产模型以**人民币(元/百万Token)计价,海外模型以美元(USD/百万Token)**计价;价格均为厂商公开的标准零售价格,不含企业定制、批量折扣。具体的各个模型的价格计算可能比下图/表列举的复杂一点,这里就不展开了,大致比较一下。

ChatGPT Image 2026年7月21日 19_46_09
模型 标准输入价 标准输出价 缓存命中输入价 定价规则与备注
Kimi K3 20 元 100 元 2 元 全上下文窗口统一费率,支持1M token上下文
DeepSeek V4 Pro 3 元 6 元 0.025 元 默认开启思考模式无额外加价,1M token上下文统一价
GLM-5.2 8 元 28 元 2 元 全上下文窗口统一费率,支持1M token上下文
Qwen3.8-Max-Preview 约 12 元* 约 36 元* 约 1.2 元* *参考上一代Qwen3.7-Max官方标准价推算;当前为预览阶段,无公开按量付费单价,仅通过订阅Credits计费,预览期享标准价1折优惠
MiniMax-M3 ≤512K:2.1 元 >512K:4.2 元 ≤512K:8.4 元 >512K:16.8 元 ≤512K:0.42 元 >512K:0.84 元 官方永久五折后价格,按输入Token长度阶梯计费
GPT-5.6 Sol $5.00 $30.00 $0.50 GPT-5.6系列旗舰版本;同系列还有均衡版Terra($2.5/$15)、轻量版Luna($1/$6)两个档位
Claude Fable 5 $10.00 $50.00 - Anthropic当前旗舰模型,1M token上下文;官方支持上下文缓存(约90%折扣),具体费率未单独公示

可以看到,Kimi K3在国产开源模型中,参数量最大,价格也最高,比此前我觉得贵的GLM-5.2还要贵,不过比GPT和Claude这2个顶级闭源模型便宜。

排名对比

我这几天看到的 Kimi K3 评价都是比较好的,这里再看一下跑分排名吧,这里的排名有专业评测和真人主观评价等不同模式。

Kimi K3、DeepSeek V4 Pro-Preview、GLM-5.2、MiniMax-M3

LiveBench 排名

核心特点:每月更新测试题目,所有问题都有客观标准答案,彻底避免 AI 模型训练数据污染问题

评估维度:数学推理、代码生成、知识问答等多个领域,强调模型的真实学习与问题解决能力

适用场景:适合评估模型的客观能力边界,而非主观用户偏好

官网:https://livebench.ai/

综合排名:Kimi K3来到了第6名。

image-20260721195649614

更多排名情况(数值为得分,得分下面是排名):基本全是最强的

Gemini_Generated_Image_24mrqs24mrqs24mr

LMArena 排名

核心机构:加州大学伯克利分校 LMSYS 组织开发维护

核心机制:匿名盲测对战,用户在不知模型身份的情况下对两个 AI 回答投票,采用国际象棋 ELO 评分系统

覆盖范围:全球 190 + 主流大模型,涵盖文本对话、数学推理、编程、图像生成等多个竞技场

特点:

  • 月活用户 500 万 +,覆盖 150 + 国家,每月 6000 万 + 模型对话
  • 细分多语言榜单(中文、英文等),数据公开且每日更新
  • 被称为 AI 领域的 “奥运会”,结果反映真实用户体验偏好

官网:https://arena.ai/zh/leaderboard

排名对比(数值为最高排名):

模型 Text Agent WebDev
Kimi K3 8 4 1
DeepSeek V4 Pro 43 22 33
GLM-5.2 (Max) 29 11 4
MiniMax-M3 60 24 21

在前端网页开发这一项排到了全球第一

image-20260721202943678

Artificial Analysis 排名

核心特点:综合 10 项评估维度,从 “AI 智商” 角度全面衡量模型能力,包含逻辑推理、抽象思维、学习能力等

评估方法:结合客观测试与专家评审,结果具有较高参考价值

最新版本:Intelligence Index v3.0,覆盖主流闭源与开源模型

官网:https://artificialanalysis.ai/

排名对比:

评测项目 Kimi K3 GLM-5.2 MiniMax-M3 DeepSeek V4 Pro
总体综合指数 3 9 15 15
智能体真实工作任务 3 9 11 14
智能体工具使用 1 8 21 11
代码与终端能力 3 11 16 18
纯代码能力 2 14 19 14
复杂推理与知识 6 10 14 16
科学推理 1 16 5 16
物理推理 6 7 21 14
知识准确率 8 18 26 10
长上下文推理 1 9 2 19
长周期知识工作 2 7 9 10

和更多模型比较:

Artificial Analysis Intelligence Index (21 Jul '26)

从前面的一些排名中可以看到,Kimi K3 整体差不多达到了全球第三的水平,某些领域则达到了第一。

可喜可贺。

但,其实还是有较大差距的。

再来看一下LMArena 排行里面的前10名模型:可以看到这8项排名里面大多数都是GPT和Claude,国产只有12.5%。

image-20260721211913132

对国产模型的崛起,我即为之喜,又为之贺,但不可盲目自信。

实测

如开头所说,我昨天对OBS做了功能优化:

  • 实现随意框选区域进行录屏,无需多余操作;
  • 增加桌面悬浮窗,实现快速录屏和停止、快速录制选区。
  • 绘制区域进行录制时,自动添加默认音频,做到框选后就可以直接录制目标区域音视频。

更多细节后续发布。

最开始是使用GLM-5.2做的,但它一直无法处理自动设置画布分辨率的问题。之后使用 Kimi K3 得以实现。

最终效果如下图:

ScreenShot_2026-07-21_212455_215

我是obs深度用户,这项功能的增加,我认为非常使用。

还有几个小功能需要增加,预计这几天就会构建安装包并开源并给官网提交PR。

Kimi Code Plan

不出意外的话,和智谱一样的,套餐售罄:

image-20260721213040629

DeepSeek虽然最便宜,不过高峰期(白天),价格也是翻倍的。

我昨天使用的是opencode的Go套餐里面的,具体介绍我之前文章写的详细:https://mp.weixin.qq.com/s/4_cZOStFYJ-0qF8GOrv-cQ

如果你要尝试Go套餐,可以使用我的要求链接:https://opencode.ai/go?ref=VH6HNYB1GE

你和我都能获得5美元的Go额度。

现在Go套餐里面的K3模型是显示2倍用量,但我的用量依旧消耗的很快,还用了好几个赠送额度。

image-20260721213552309

同时我也订购了火山方舟的Agent Plan,里面也可以选择K3:前面的文章也分享了这个,不重复了

image-20260721213401093

思考

AI发展真的很快,我今年手写的代码很少,大多数都是AI完成的。

一些行业,用时间成本换取薪水的模式或许正在走向终结。

之前看到过一张图:

。

有点搞笑,但又不无道理。

当我们的技能变成一个个Skill 时,我们还剩下什么呢?

还剩下: 你的判断力、 你的信誉、 你的责任感、 你的随机应变能力…

这些或许才是最后无法被蒸馏的东西。

坦率地说,没有什么是绝对安全的。

AI 的发展速度已经超越了我们预测的精度。

但与其在焦虑中等待被替代,不如把 AI 当作一场倒逼我们进化的海啸。

这场海啸会冲刷掉所有平庸的、机械的技能,迫使我们去面对一个最核心的问题:

当机器可以做得比我们更好时,生而为人的独特意义到底是什么?

这是一个没有标准答案的问题。

未来已来,你认为人类最后一道不可替代的防线,到底在哪里?

我的回答:人类最后不可替代的防线,或许在于“意义的赋予”与“真实的联结”。

更多推荐