评测背景

OpenAI 发布了据称是“迄今为止能力最强”的模型:GPT-5.6 Sol。

Sol 作为高阶旗舰模型,主要面向复杂代码、深度研究、长周期 Agent、网络安全和科学分析等高难任务。

它分为 Max 和 Ultra 两种推理强度:

  • Max 侧重深度推理,为单次推理分配更多算力与思考时间,提升复杂代码生成、数学证明和长链路分析等高难任务的质量上限;

  • Ultra 偏向多智能体并行协同,更适合长流程、跨步骤的复杂任务。

我们沿用晓天衡宇大语言模型榜单评测体系,从 Agentic、Coding、General、Reasoning 四个一级维度及 18 项二级评测集,对 GPT-5.6 Sol(Max)进行了全面评测。

我们想探究的是:

  • GPT-5.6 Sol(Max)和当前排名更靠前的 Claude Fable 5 正面对比,差距在哪里?

  • 和前代 GPT-5.5(xhigh)比,GPT-5.6 Sol(Max)的提升体现在哪些层面?

  • 综合能力和效率来看,GPT-5.6 Sol(Max)是否值得选、适合怎样选?

榜单概览 访问晓天衡宇评测社区,查看大语言模型7月榜单完整结果。

核心结论

结论一:Agentic 维度略超 Fable 5,自主规划是长板

GPT-5.6 Sol(Max)获得总榜第 2 名,仅次于 Claude Fable 5,前代 GPT-5.5(xhigh)暂居第 3。

能力结构上,它并非全面落后于 Fable 5,在 Agentic 一级维度上实现了轻微的超越。Sol(Max)的长处在于复杂任务上的自主性:主动拆解目标、规划任务路径,但工具执行、知识交互和任务闭环层面暂未同步提升。

两者差距集中在知识储备、记忆、场景推理、数学推理等基础能力层面。整体而言,Fable 5 能力覆盖仍然更完整。

结论二:跨代对比,同价且能力略强

GPT-5.6 Sol(Max)与 GPT-5.5(xhigh)定价几乎相同,四个一级维度均有小幅提升,集中体现在自主规划、多语言工程和幻觉控制等。

更显著的变化在于效率侧:Sol(Max)的 Token 消耗减少了 14%。

对 GPT-5.5(xhigh)用户而言,切换到 Sol(Max)意味着能力没有退步、单价基本不变、调用成本更低。

结论三:相比 Fable 5 成本优势更明显

GPT-5.6 Sol(Max) 推理成本比 Claude Fable 5 低 40%,比 GPT-5.5(xhigh)低 14%。

它的优势不是单纯输出快或更省 Token,而是以更低的调用成本提供了三者中次高的综合能力。

评测体系

本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估,基于加权分数计算模型的平均得分进行排序。

其中,智能体占比最高为 35%,代码与推理各占 25%,通用占 15%。

深度解读

Sol(Max)强在哪,弱在哪?

总分层面,GPT-5.6 Sol(Max)得分 69.10,较 Claude Fable 5 落后 1.62 分,最主要的差距集中在 General 维度。它并非全面落后于榜单第 1 名,在 Agentic 维度则实现了轻微的超越。

对比 GPT-5.5(xhigh),GPT-5.6 Sol(Max)四项均有小幅度提升,总分领先 0.75 分。

只看差值很难得出显著提升或落后的结论。

GPT-5.6 Sol(Max)的性能究竟强在哪里、短板又藏在哪,体现了什么样的代际提升策略?我们还要下探到二级维度来看。

Agentic:总分微弱领先,规划能力优势明显

在 Agentic 维度上 GPT-5.6 Sol(Max) 得分 57.60,略微领先 Claude Fable 5 0.22 分。

从二级维度看:

GPT-5.6 Sol(Max)的 Agentic 表现可以概括为规划能力有提升,执行能力维持稳定:

  • DeepPlanning 是 GPT-5.6 Sol(Max)优势最明显的一项,得分 62.3,大幅领先 Claude Fable 5 7.3 分。这表明它在复杂目标拆解、步骤编排和长任务路径规划方面表现相对更强。

  • BrowseComp-ZH 上 GPT-5.6 Sol(Max)得分落后于 Fable 5,较 GPT-5.5(xhigh)的 48.3 有所提升。它在网页检索与工具协同等方面的表现虽已有代际进步,但尚未超过 Claude Fable 5。

  • TAU3-Bench 上 GPT-5.6 Sol(Max)得分 82.1,低于 Claude Fable 5 的 86.73,也略低于 GPT-5.5(xhigh)的 82.7。从代际提升角度来看,它的优化重心更偏向规划,而在知识落地、多轮交互及执行闭环等方面则基本保持在原有水平。

  • Seal-Hard 上 GPT-5.6 Sol(Max)与 GPT-5.5(xhigh)同为 35.3 分,Claude Fable 5 为 35.0 分,三者未形成明显差异。

Coding:多语言工程赶上,终端和科学计算是短板

Coding 方面 GPT-5.6 Sol(Max)得分 76.22,落后 Claude Fable 5 2.49 分,领先 GPT-5.5(xhigh)1.39 分。

具体来看,它的提升并非平均分布在所有 Coding 子维度上,主要集中在多语言软件工程。

从二级维度看:

GPT-5.6 Sol(Max)在 Coding 上长于代码库理解和工程修改,相对弱于终端执行与科研编程。

  • SWE-Multilingual 上,GPT-5.6 Sol(Max)得分 86.87,较 GPT-5.5(xhigh)提升 7.2 分,是最明显的进步项,与 Claude Fable 5 仅差 1.98 分。在代码库理解、跨语言定位问题和工程修改能力上开始接近领先水平。

  • ClawEval 上,GPT-5.6 Sol(Max)得分 84.7,仅落后 Claude Fable 5 约 1.28 分,较 GPT-5.5(xhigh)提升 0.4 分。它在通用代码辅助能力上保持了前代水平,代际变化不大。

  • Terminal-Bench-Pro 与 SciCode 是 GPT-5.6 Sol(Max)相对明显的短板。得分分别为 57.81 和 56.9,与 Fable 5 差值明显。前者相较 GPT-5.5(xhigh)还略有下降。这表明它在终端操作、调试纠错及科研代码任务上还有提升空间。

  • Livecode-Bench-V6 上三者没有明显分差,算法编程能力基本相当。

General:指令遵循强于 Fable 5,知识覆盖是明显短板

General 维度是 GPT-5.6 Sol(Max)与 Claude Fable 5 差距最大的维度,落后 4.66 分。相较 GPT-5.5(xhigh)略微提升,但更值得关注的是三者之间的通用能力结构差异。

从二级维度看:

GPT-5.6 Sol(Max)的通用能力分化明显:幻觉控制有进步,指令遵循有相对优势,知识广度、记忆和长文本处理待提升。

  • 指令遵循上,GPT-5.6 Sol(Max)得分 72.7,领先 Claude Fable 5 9.2 分。在格式约束、流程遵循上,它的表现更优,更擅长明确按照要求作答。但此单项上 GPT-5.6 Sol(Max)反而较 GPT-5.5(xhigh)出现了明显退步。

  • 知识储备、记忆及长上下文上,GPT-5.6 Sol(Max)分别落后 Claude Fable 5 10.1 分、5.35 分和 2.5 分。结合代际差异来看,GPT-5.6 Sol(Max)更像是小幅度补齐记忆短板,长上下文能力则基本持平。

  • 幻觉控制是 GPT-5.6 Sol(Max)代际进步相对突出的一项,得分 71.25,较 GPT-5.5(xhigh)提升 4.4 分,在事实准确性上表现相对更优,但与 Claude Fable 5 仍有 4.55 分差距。

Reasoning:科学推理领先,场景推理相对落后

Reasoning 层面,GPT-5.6 Sol(Max)得分 76.80,落后 Claude Fable 5 1.49 分。较 GPT-5.5(xhigh)提升幅度不算大,更像是守住已有竞争力优势,而未形成明显突破。

从二级维度看:

GPT-5.6 Sol(Max)的科学推理表现突出,场景推理相对偏弱。

  • 科学推理是 GPT-5.6 Sol(Max)的优势所在:得分 94.1,反超 Claude Fable 5,也是较 GPT-5.5(xhigh)涨幅最大的一项。这说明 GPT-5.6 Sol(Max)在三个模型中更擅长基于专业知识进行分析推论。

  • 场景推理则是落后最明显的维度:GPT-5.6 Sol(Max)得分 50.5,落后 Claude Fable 5 3.4 分。在日常情景理解和常识推断方面,它的表现相对于 Fable 5 还有提升空间。

  • 数学推理上 GPT-5.6 Sol(Max)得分 84.43,明显落后 Claude Fable 5 2.47 分,较 GPT-5.5(xhigh)也微降 0.47 分,未出现明显代际提升。

效率分析

优势不在最快,在能力-成本平衡

推理速度差异:同一梯队中上区

GPT-5.6 Sol(Max)的推理速度为 68 tokens/s,它相比 GPT-5.5(xhigh)慢约 13%,比 Claude Fable 5 则快了约 6%,在同梯队模型中属于中等偏上的速度水平,三者之间并未形成决定性的速度差距。

推理速度反映模型开始回答后的生成节奏。在实际体验中,GPT-5.6 Sol(Max)的回答展开速度会略微快于 Fable 5,但不及上一代模型。

API 价格差异:与前代基本持平,显著低于 Fable 5

GPT-5.6 Sol(Max)的 API 价格为 78.8 RMB,与 GPT-5.5(xhigh)的 78.75 RMB 基本持平,比 Fable 5 的 140 RMB 低约 44%。

这样的 API 单价意味着 GPT-5.6 Sol(Max)基本上做到了同价升级,价格微增但能力相对更强;相较于 Fable 5,它则以明显的价格优势提供了接近的能力表现。

模型能力×Token 消耗差异:代际改善明显

单看本次评测中的 Token 消耗表现,GPT-5.6 Sol(Max)为 36 MTokens,处于三者的中间地带。

相比于 GPT-5.5(xhigh),它的 Token 消耗减少约 14%,能力提高 0.75 分。这说明 Token 使用效率整体有所提升。

Fable 5 则以更低的 34 MTokens 换来了更高的能力得分,仅论 Token 使用效率,它是最具优势的。

不过更省 Token 并不能等同于最终更便宜,Fable 5 的 API 单价会部分抵消用量方面的优势,引入推理成本对比会更明显。

模型能力×推理速度:各有取舍,未拉开明显梯度

结合模型能力与推理速度来看,三款模型在速度—能力坐标上各有取舍,并未形成明显的绝对领先:

  • GPT-5.6 Sol(Max)能力与速度均处于中间区间。

  • GPT-5.5(xhigh)相对输出速度最快,能力表现略微落后。

  • Fable 5 在本组模型能力总分最高,速度相对最慢。

模型能力×推理成本:性价比优势显现

结合模型能力和推理成本来看,GPT-5.6 Sol(Max)的相对优势终于显现。

它的推理成本为 70920 RMB,在本次对比的模型中是最低的,约为 Claude Fable 5 的 60%、GPT-5.5(xhigh)的 86%。

相比前者,它的能力已经相对接近,成本节省却很明显;相比后者,它省了成本,还提升了能力。

因此,GPT-5.6 Sol(Max)优势不在于能力、速度或单项效率的绝对领先,而是成本和能力的平衡做到了三者最优。

综合判断

GPT-5.6 Sol(Max)是当前前沿模型中能力最接近 Fable 5、且成本相对更低的选择。

能力结构上,GPT-5.6 Sol(Max)优势在规划能力。相对于 GPT-5.5(xhigh),它的升级体现在自主规划与代码库工程能力,更擅长复杂目标拆解、路径设计、代码理解、工程修改,但工具执行与交互闭环方面未有明显的同步提升。在知识储备、长上下文、科研编程、场景与数学推理方面,它与综合能力更强的 Fable 5 仍有差距。

效率表现上,它不是单纯输出最快或 Token 用量最省的前沿模型。它凭借相对较低的单价和相对较少的 Token 用量,最终将调用成本压到了三款前沿模型中的最低。单次调用成本更低,在高频场景下成本优势会更明显。

实际选型上,GPT-5.6 Sol(Max)是值得的:如果涉及高频运行工作流,同时需要控制调用成本,GPT-5.6 Sol(Max)相对更具有吸引力。Fable 5 作为综合能力更强的模型,承担低频高价值任务首选;GPT-5.5(xhigh)的吸引力则在于三者最快的输出速度。

注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。

写在最后

最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网,欢迎大家访问查看更详细的评测数据。

👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~ 

更多推荐