评测背景

2026年7月16日,MoonShot AI 发布新一代旗舰模型 Kimi-K3,重点面向代码生成、复杂推理、长上下文处理、智能体任务与办公自动化等真实生产场景。

相比 Kimi-K2.5 与 Kimi-K2.6,Kimi-K3 在综合能力、代码、推理和长上下文方面实现了显著跃升。

本次我们基于晓天衡宇大语言模型榜单评测体系,从 Agentic、Coding、General、Reasoning 四个一级维度及 18 个主流评测集,对 Kimi-K3 进行了系统评估。

这篇解读不只关注 Kimi-K3 的排名,更聚焦以下问题:

  • 与 Claude Fable 5、GPT-5.6 Sol(Max)、GPT-5.5(xhigh)相比,优势和短板分别是什么?

  • 相比 Kimi-K2.5 和 Kimi-K2.6,其进步主要体现在哪些方面?

榜单概览

点击跳转晓天衡宇评测社区,查看大语言模型7月榜单完整结果。

核心结论

结论一:Kimi-K3 位列总榜第 4,成为国产模型第一

Kimi-K3 综合得分 68.31,总榜第 4,国产及开源模型均排名第一。

距离 GPT-5.5(xhigh)仅差 0.04 分,距离 GPT-5.6 Sol(Max)仅差 0.79 分,说明 Kimi-K3 与本文对比模型的得分已基本处于同一水平。

结论二:Kimi-K3 相比前两代实现明显跃迁

从自身迭代来看,Kimi-K3 的提升明显:相比 Kimi-K2.5 提升 12.34 分,相比 Kimi-K2.6 提升 6.88 分。这说明它并非小幅修补,而是一次能力档位升级,尤其在编程、推理、长上下文和指令遵循等关键维度上,较前两代实现了显著跃升。

结论三:Coding 优势明显,Reasoning 和 General 表现均衡

Kimi-K3 的 Coding 能力在本次对比模型中排第 2,在多语言工程和复杂代码理解任务中相对突出;Reasoning 虽与 Claude Fable 5、GPT-5.6 Sol(Max)仍有差距,但科学推理和逻辑推理表现亮眼;General 方面,长上下文和指令遵循是主要优势,其中指令遵循能力相对突出。

结论四:Kimi-K3 速度偏慢但成本优势突出

从效率维度看,Kimi-K3 在本次对比模型中并不占优。

但成本优势明显:Token 消耗低于 Claude Fable 5、GPT-5.6 Sol(Max)和 GPT-5.5,推理成本仅为 GPT-5.5 的 34.3%、Claude Fable 5 的 23.8%、GPT-5.6 Sol(Max)的 40.0%。

Kimi-K3 的核心竞争力不在于极致响应速度,而在于以相对可控的成本提供较高的综合能力。

评测体系

本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估,并根据加权分数计算模型平均得分。

其中,智能体占比最高,为 35%;代码和推理各占 25%;通用占 15%。

深度解读

Kimi-K3 与同梯队模型的差距在哪里?

从分数来看,Kimi-K3 已经进入总榜前四,但它的能力结构并不是全面均衡,呈现出“代码强、推理稳、Agentic 有短板”的特征。

下面我们直接对比 Kimi-K3 与 Claude Fable 5、GPT-5.6 Sol(Max)、GPT-5.5(xhigh)的一级维度和二级维度得分,分析 Kimi-K3 的能力边界。

Agentic:任务执行能力强,复杂规划是主要短板

Kimi-K3 的 Agentic 得分为 54.98,位列榜单第 4,距 Claude Fable 5(-2.40)、GPT-5.6 Sol(Max)(-2.62)、GPT-5.5(xhigh)(-2.00)。

整体来看,Agentic 是 Kimi-K3 相对薄弱的环节,距离本次对比中的模型仍有一定的追赶空间。

从二级维度看:

Kimi-K3 的 Agentic 能力呈现“高执行、弱规划”的特征。

TAU3-Bench 得分达到 85.62,仅次于 Claude Fable 5,它在多步任务执行、交互式决策和流程推进上具备较强可用性。

BrowseComp-ZH 得分为 51.87,在中文浏览、信息检索和综合判断任务中表现相对稳健。

DeepPlanning 仅 47.50,与 GPT-5.6 Sol(Max)(-14.80)、GPT-5.5(xhigh)(-14.17)差距明显,意味着在高难度、长链路、强约束的任务中仍具有提升空间。

2. Coding:排行第二,是 Kimi-K3 核心优势项

Kimi-K3 的 Coding 得分为 77.67,位列榜单第二,仅次于 Claude Fable 5(-1.04),已超过 GPT-5.6 Sol(Max)(+1.45)和 GPT-5.5(xhigh)(+2.84)。

综合来看,Coding 是 Kimi-K3 最突出的核心优势,在本期评测的模型中处于领先水平。

从二级维度看:

LiveCode-Bench 得分 94.30,在本文对比模型中暂居末位,常规编程与算法实现仍有提升空间。

SWE-Multilingual 得分 93.00,远超 Claude Fable 5、GPT-5.6 Sol(Max)和 GPT-5.5(xhigh),在多语言代码理解和跨语言修复方面优势明显。

ClawEval 得分 84.33,与 GPT-5.5 和 GPT-5.6 Sol 基本持平,通用代码辅助能力可靠。

SciCode 得分 58.70,高于 GPT-5.6 Sol(Max)和 GPT-5.5(xhigh),科学代码能力也得到验证。

短板主要集中在复杂终端执行上:Terminal-Bench 得分 58.00,与 Claude Fable 5 相差 5.74 分,距离前沿模型还有追赶空间。

3.General:指令遵循突出,知识与幻觉仍需关注

Kimi-K3 的 General 得分为 71.11,与 GPT-5.6 Sol(Max)(-0.15)差距极小,领先 GPT-5.5(xhigh)(+0.64),但与 Claude Fable 5(-4.81)仍有明显差距。

从二级维度看:

Kimi-K3 的 General 能力呈现“强遵循、强上下文,知识稳定性偏弱”的特点。

优势项:指令遵循 82.65,是该维度最突出的优势,对复杂任务要求和多约束提示词执行能力强。

长上下文 88.90,与 GPT-5.6 Sol(Max)持平,稍高于 GPT-5.5(xhigh),但仍落后于 Claude Fable 5(-2.50)。

知识 44.30,幻觉得分 66.30,低于 Claude Fable 5 和 GPT-5.6 Sol(Max),在专业知识、事实核验等事实密集型任务中表现仍有提升空间。

4. Reasoning:科学推理和逻辑推理突出,场景推理明显偏弱

Kimi-K3 的 Reasoning 得分为 75.95,位列总榜单第 5。

距 Claude Fable 5(-2.34)、GPT-5.6 Sol(Max)(-0.85)、GPT-5.5(xhigh)(-0.55)。总体来看,Kimi-K3 的推理能力与上述对比模型存在一定差距,但多数差距在 1 分以内,属于可追赶范围。

从二级维度看:

Kimi-K3 的推理能力结构清晰,优势与短板分明。

科学推理 93.50,在本文对比模型中表现突出,仅低于 GPT-5.6 Sol(Max)(-0.60)。

逻辑推理 78.70,在规则明确、链式推导类任务中能力较强;数学推理 82.10,表现稳定。

场景推理是该维度的主要薄弱环节,相较于 Claude Fable 5(-4.42)说明 Kimi-K3 在贴近真实世界、需理解隐含条件和多因素权衡的任务中仍不够稳定。

效率分析

推理速度:相对低速换取更高能力表现

推理速度上,Kimi-K3 为 38 Tokens/s,与 GPT-5.6 Sol(Max)(68 Tokens/s)、Claude Fable 5(64 Tokens/s)和 GPT-5.5(xhigh)(78.6 Tokens/s)相比,Kimi-K3 的响应速度并不占优。

但从能力表现看,Kimi-K3 以 38 Tokens/s 的速度取得 68.31 分、进入总榜第 4,呈现出以相对低速换取较高能力表现的特征。

API 价格:成本低于海外同梯队模型

API 价格上,Kimi-K3 为 42 RMB,处于中价区间。

与海外同梯队模型相比,Kimi-K3 的价格优势明显:Claude Fable 5 为 140 RMB,约为 Kimi-K3 的 3.3 倍;GPT-5.6 Sol(Max)、GPT-5.5(xhigh)约为其 1.9 倍。

整体来看,Kimi-K3 在本次对比模型中保持了较低的 API 单价,综合能力与成本之间实现了相对平衡。

模型能力 × Token 消耗差异:Token 效率突出,以更低消耗实现接近的能力

Token 消耗上,Kimi-K3 为 27 MTokens,低于 GPT-5.5(xhigh)(42 MTokens)、GPT-5.6 Sol(Max)(36 MTokens)和 Claude Fable 5(34 MTokens)。

以 27 MTokens 取得 68.31 分,在同梯队模型中展现出较高的 Token 利用效率。

模型能力 × 推理成本:成本效率优于同梯队海外模型

Kimi-K3 推理成本为 28,350 RMB,约为 Claude Fable 5(119,000 RMB)的 23.8%、GPT-5.5(xhigh)(82,688 RMB)的 34.3%、GPT-5.6 Sol(Max)(70,920 RMB)的 40.0%。

在综合得分接近 GPT-5.5 (xhigh)的情况下,Kimi-K3 以不到其四成的成本实现相近能力,成本效率优势明显。

代际对比

Kimi-K3 相比前两代完成能力跃迁

从 MoonShot AI 自身模型迭代来看,Kimi-K3 相比 Kimi-K2.5 和 Kimi-K2.6 的提升非常明显,能力实现了跃迁。

按照本榜单综合得分 Kimi-K3 68.31,较 K2.6(+6.88),较 K2.5(+12.34)。

Kimi-K3 参数规模由 K2.5/K2.6 的 1000B 提升至 2800B,成为榜单中目前规模最大的开源模型。

参数规模的扩大为其能力上限提供了基础,并最终转化为 Coding、科学推理、长上下文和指令遵循等关键维度的实际提升。

Kimi-K3 推理速度 38 Tokens/s,与 K2.5(39.4)基本持平,较 K2.6(34)有所回升。

三代速度维持在 40 Tokens/s 左右,但综合能力从 55.97 提升至 68.31(+12.34)。这说明 K3 的进步并非牺牲速度换来的,而是在相近速度区间内实现了能力的大幅提升。

Kimi-K3 Token 消耗为 27 MTokens,较 K2.6(+8 MTokens)、K2.5(+10 MTokens)。

消耗虽有增加,但能力增幅更显著:较 K2.6 提升 6.88 分,较 K2.5 累计提升 12.34 分。这说明 K3 的升级以更高消耗换来了更强的能力产出。

Kimi-K3 推理成本为 28,350 RMB,较 K2.6(3,325 RMB)和 K2.5(2,975 RMB)大幅上升。

这表明 K3 已定位为高能力旗舰模型,不再追求轻量低成本。

轻量任务或成本敏感场景,K2.5、K2.6 仍有适用空间;但在复杂代码生成、深度推理、长文档处理等高质量生产任务中,K3 的能力提升足以支撑更高的调用成本。

综合判断

综合本次评测结果,Kimi-K3 在代码能力表现突出,综合得分位列总榜第 4,是本期榜单中国产及开源模型均排名第一的模型。

能力侧,Kimi-K3 目前在晓天衡宇大语言榜单总榜排名第 4,Coding 排名第 2。Reasoning 和 General 表现相对稳定,在科学推理、逻辑推理、长上下文和指令遵循方面展现出较强竞争力。

从自身迭代来看,Kimi-K3 在速度基本稳定的前提下,综合能力较前两代大幅提升;Token 消耗和推理成本有所增加,但换来了 Coding、Reasoning 和长上下文能力的明显增强。在本次对比模型中,Kimi-K3 的推理速度和成本并非最优,但消耗水平处于中等区间,能力与成本之间的平衡值得关注。

Agentic 是 Kimi-K3 相对薄弱的环节,在复杂规划、长链路自主执行以及高难度场景推理中稳定性不足;General 维度中的知识与幻觉得分同样需要关注。

注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。

写在最后

最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网,欢迎大家访问查看更详细的评测数据。

👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~ 

更多推荐