7月的大模型圈很热闹。

OpenAI 的 GPT-5.6 Sol 刚结束政府审核全面开放,Anthropic 的 Claude Fable 5 解除出口管制重新上线,月之暗面的 Kimi K3 以全球最大开源模型的姿态杀进前三——三大旗舰模型第一次在同一个月内全部可用。

问题来了:到底选谁?

这篇横评把三大模型在编程、Agent、推理、文档理解、速度、价格六个维度上掰开了看。数据来源统一用独立评测机构(Artificial Analysis、VulcanBench、Arena AI),不用厂商自报数据。

先给结论:没有绝对的第一名。三个模型各有一个不可替代的长板。


一、综合智能:Fable 5 守擂,但差距极小

Artificial Analysis Intelligence Index 给出了综合评分:

排名

模型

综合智能指数

1

Claude Fable 5

60

2

GPT-5.6 Sol

59

3

Kimi K3

57

前三名只差3分。这是什么概念?去年同期的前三名分差是两位数。 模型能力的趋同速度比任何人预想的都快。

但综合分掩盖了细节。拆到具体能力维度,三个模型的优劣势完全错开。


二、编程:K3 登顶前端,Fable 5 统治工程

前端编程(Frontend Code Arena)

这是 Kimi K3 最亮眼的战场。

模型

得分

差距

Kimi K3

1679

Claude Fable 5

1631

-48

GPT-5.6 Sol

1618

-61

K3 在前端七个细分领域中六个位居第一。干净利落的 UI 组件生成、准确的 CSS 布局、更少的迭代次数——在前端编程这个场景下,K3 是实至名归的第一。

长程软件工程(SWE Marathon / FrontierSWE)

但到了复杂的、需要长周期自主完成的软件工程任务上,Fable 5 夺回优势:

评测

Claude Fable 5

GPT-5.6 Sol

Kimi K3

SWE Marathon

48%

44%

42%

FrontierSWE

86.6

71.3

81.2

Terminal Bench

76%

73%

71%

Fable 5 在需要持续数小时乃至数十小时的自主编程任务上依然是标杆。 K3 在 FrontierSWE 上拿到81.2分大幅领先 Sol,但与 Fable 5 的86.6仍有差距。

VulcanBench 的真实 PR 数据更直观——用23个真实合并过的开源项目PR来测试:

模型

完成率

总成本

每任务耗时

Claude Fable 5

20/23 (87%)

$20.82

4.3分钟

GPT-5.6 Sol

20/23 (87%)

$15.90

4.2分钟

Kimi K3(标准)

17/23 (74%)

$16.84

18.1分钟

Kimi K3(加预算)

20/23 (87%)

$27.43

28.3分钟

K3 给够预算和时间(2小时上限),也能追平 Fable 5 和 Sol 的完成率。但耗时是后两者的6-7倍。 这是 K3 最核心的代价——用时间换能力。


三、Agent 与知识工作:Fable 5 第一,K3 反超 Sol

AA-Briefcase 是一个很有意思的评测——模拟真实企业办公环境,给模型扔25000+条Slack消息、3500+封邮件、会议纪要和财务报表,要求产出Excel财务模型和董事会PPT。

模型

AA-Briefcase 得分

Claude Fable 5

1574

Kimi K3

1543

GPT-5.6 Sol

1501

K3 在这个维度反超了 Sol。说明在处理长周期、碎片化信息的复杂办公任务上,K3 的大上下文窗口(100万token)和长程推理能力发挥了作用。

GPQA Diamond(研究生级科学推理):

模型

得分

Claude Fable 5

74%

GPT-5.6 Sol

72%

Kimi K3

68%

Fable 5 的推理深度依然是三者中最强的。


四、多模态与文档理解:K3 的另一个杀手锏

OmniDocBench 视觉理解测评中,K3 以 91.1分登顶,超越 Fable 5 和 Sol。这是 K3 除前端编程外第二个拿第一的领域。

K3 原生支持视觉理解(在预训练阶段就同时处理文本和图像),不是后期嫁接的多模态能力。对于需要大量文档理解、图表解析的企业场景,K3 有明显优势。


五、速度与可靠性:K3 的硬伤

这是三个模型之间最悬殊的差距。

速度

模型

同等任务耗时

相对速度

Claude Fable 5

~3.5分钟

基准(最快)

GPT-5.6 Sol

~4分钟

接近

Kimi K3

~12分钟

慢3倍+

同样的代码缺陷修复任务,Fable 5 3.5分钟,K3 12分钟。而且 K3 比 Fable 5 和 Sol 慢2-3倍是普遍现象,不是个别任务。

幻觉率

模型

幻觉率

Claude Fable 5

~12%

GPT-5.6 Sol

~15%

Kimi K3

~51%

K3 51%的幻觉率是个严重问题。这意味着超过一半的回复可能包含不准确信息。对于知识密集型任务,K3 的输出需要人工校验。Fable 5 的12%在可用性上是另一个量级。


六、价格:看单价没用,看「完成一个任务的成本」

API 定价(每百万Token)

模型

输入

输出

缓存命中

Kimi K3

¥20 ($3)

¥100 ($15)

¥2 ($0.30)

GPT-5.6 Sol

$5

$30

$0.50

Claude Fable 5

$10

$50

$1

只看单价,K3 最便宜——输出价格只有 Fable 5 的30%。但这张表有欺骗性。

K3 的一个关键问题:输出冗长。 第三方实测数据显示,K3 完成同样任务消耗约25K tokens,而 Sol 只需15K左右,Fable 5 约18K。K3 的长推理链和不结构化的 Thinking 输出导致 token 消耗明显偏高。

算「完成一个任务的真实成本」:

模型

单价(输出)

平均Token/任务

估算成本/任务

Kimi K3

$15/M

~25K

~$0.38

GPT-5.6 Sol

$30/M

~15K

~$0.45

Claude Fable 5

$50/M

~18K

~$0.90

K3 仍然是最便宜的,但优势从「便宜70%」缩水到「便宜约15%」。Fable 5 贵但精准,总成本可能更低——完成同样任务所需的轮次更少,不需要反复纠正。

另外,Fable 5 在处理超长上下文(超272K tokens)时不加价,Sol 有2倍输入/1.5倍输出的长上下文附加费。


七、一张表看完所有数据

评测维度

🥇 第一

🥈 第二

🥉 第三

综合智能

Fable 5 (60)

Sol (59)

K3 (57)

前端编程

K3 (1679)

Fable 5 (1631)

Sol (1618)

FrontierSWE

Fable 5 (86.6)

K3 (81.2)

Sol (71.3)

SWE Marathon

Fable 5 (48%)

Sol (44%)

K3 (42%)

Agent知识工作

Fable 5 (1574)

K3 (1543)

Sol (1501)

文档理解

K3 (91.1)

Fable 5

Sol

科学推理

Fable 5 (74%)

Sol (72%)

K3 (68%)

真实PR任务

Fable 5 (87%)

Sol (87%)

K3 (74%/87%)

速度

Fable 5 (最快)

Sol (接近)

K3 (慢3倍)

幻觉率

Fable 5 (~12%)

Sol (~15%)

K3 (~51%)

输出单价

K3 ($15)

Sol ($30)

Fable 5 ($50)

任务成本

K3 (~$0.38)

Sol (~$0.45)

Fable 5 (~$0.90)

上下文定价

Fable 5 (不加价)

K3

Sol (加价)


八、三句话选模型

选 Kimi K3,如果:

  • 你做的是前端开发、UI组件生成、CSS布局——这是K3的地盘
  • 你需要处理大量文档和图表(OmniDocBench 91.1分)
  • 你的场景是长周期自主编程,不介意等12分钟换一条高质量输出
  • 预算优先,且能接受较高幻觉率需要人工校验
  • 你需要开源模型,想自己微调或私有化部署

选 Claude Fable 5,如果:

  • 你做的是复杂软件工程、多文件重构、大规模代码迁移——Fable 5是唯一选择
  • 准确率 > 一切——12%幻觉率,省去大量纠错时间
  • 你跑的是Agent工作流,需要模型稳定执行多步骤复杂任务
  • 你处理超长上下文(>272K tokens),不想付附加费
  • 你能接受最高的单价,换最可靠的结果

选 GPT-5.6 Sol,如果:

  • 你需要速度、成本、能力的三角平衡——不是最强也不是最便宜,但可能是最「全面」
  • 你做的是安全相关的编程任务(ExploitBench表现优异)
  • 你已经在 OpenAI 生态里(ChatGPT、Codex、Assistants API)
  • 你需要分级定价——Sol/Terra/Luna三档,不同任务匹配不同成本

九、最佳实践:别只用一个

三个模型的长板完全错开。实际生产中的最优策略不是「选一个」,而是三模型组合

前端开发 → Kimi K3(1679分,前端最强)

复杂工程 → Claude Fable 5(86.6 FrontierSWE)

日常编码 → GPT-5.6 Sol(速度+能力平衡)

文档解析 → Kimi K3(91.1 OmniDocBench)

Agent任务 → Claude Fable 5(1574 AA-Briefcase)

成本敏感 → Kimi K3(便宜)+ GPT-5.6 Luna(更便宜)

但问题是——如果每个模型都去一家平台单独开户、充值、管理Key,管理成本很高。

实际方案是通过API聚合平台统一管理。 比如 魔芋 已经接入了 Kimi K3(含K2.6/K2.5全系列),同时支持 Claude 和 GPT 全系列,国内外模型一个Key调用。开发者不需要分别对接月之暗面、Anthropic、OpenAI三家——改个model参数就能切换模型,按任务需求灵活选型。

体验网址:https://www.moyu.info/register?aff=g2d7  (通过该连接注册后可获得¥2额度体验,私信我还可以额外我获赠¥5账户体验额度并进行账户开白)


写在最后

2026年7月的模型格局传达了一个清晰信号:绝对领先的时代结束了。

一年前,GPT-5 对其他模型是「碾压级」优势。现在,前三名综合分只差3分——每个维度各有人赢,没有一个模型能包揽所有第一。

K3 的崛起尤其值得关注:一个开源模型,在前端编程和文档理解两个领域拿了世界第一。7月27日完整权重开放后,基于K3的微调模型和领域适配版会大量涌现。

但 K3 的短板也足够明显——速度慢3倍、幻觉率51%、上线48小时就因算力崩溃暂停C端订阅。这不是一个「能用就完事」的模型,而是一个需要精心选择场景、接受其代价的「偏科尖子生」。

选模型这件事,以后不是比「谁最强」,而是比「谁最合适」。

更多推荐