先给结论:

Claude Opus 5 已于 2026 年 7 月 24 日正式发布。标准 API 价格仍是输入 $5/百万 Token、输出 $25/百万 Token,支持 100 万 Token 上下文和 12.8 万 Token 最大输出。真正需要注意的不是模型 ID,而是 thinking 默认开启,以及在 xhighmax 下禁用 thinking 会直接返回 HTTP 400。

本文基于 Anthropic 官方发布页、Claude Platform 模型文档和价格文档,以及 Artificial Analysis 的独立测量整理。数据核验时间为 2026 年 7 月 25 日。

所有 Benchmark 会明确区分:

  • Confirmed:官方规格或价格;

  • Independent measurement:第三方独立测量;

  • Vendor claim:Anthropic 官方 Benchmark 声明,尚未独立复现。

一、Claude Opus 5 的核心规格

Opus 5 是正式可用模型,API ID 为 claude-opus-5

项目Claude Opus 5证据级别
发布时间2026-07-24Confirmed
Claude API IDclaude-opus-5Confirmed
上下文窗口1,000,000 TokenConfirmed
最大输出128,000 TokenConfirmed
输入模态文本、图片Confirmed
输出模态文本Confirmed
Thinking默认开启Confirmed
Effort 档位lowmediumhighxhighmaxConfirmed
默认 EfforthighConfirmed
最短可缓存 Prompt512 TokenConfirmed

官方说明中有两个容易被忽略的细节。

第一,100 万 Token 既是默认值,也是最大值。Opus 5 没有一个更小的上下文版本需要单独选择。

第二,max_tokens 同时限制 thinking Token 和最终可见输出。原来针对 Opus 4.8 非思考请求设置的输出上限,迁移后可能不够。

官方资料:

二、价格没涨,但一次任务不一定同价

Opus 5 与 Opus 4.8 的标准单价相同,但 Cache、Batch、Fast Mode 和区域参数会让真实成本相差 4 倍。

计费模式输入价格/百万 Token输出价格/百万 Token说明
标准模式$5.00$25.00与 Opus 4.8 相同
5 分钟 Cache Write$6.25$25.00输入写入为 1.25 倍
1 小时 Cache Write$10.00$25.00输入写入为 2 倍
Cache Hit$0.50$25.00输入便宜 90%
Batch API$2.50$12.50异步处理,打 5 折
Fast Mode$10.00$50.00Claude API 限定,研究预览
美国区域推理$5.50$27.50全部 Token 乘 1.1

Fast Mode 不能与 Batch API 同时使用。Cache 和数据驻留乘数则可能与其他受支持的计费模式叠加。

完整价格以 Claude Platform Pricing 为准。

三、一个 Agent 请求到底多少钱

假设一次代码仓库 Agent 请求使用:

  • 输入:100,000 Token;

  • 输出:20,000 Token。

标准模式成本:

输入成本 = 0.10 × $5  = $0.50
输出成本 = 0.02 × $25 = $0.50
单次总成本 = $1.00

同一 Token 结构在不同模式下:

模式单次成本每月 1,000 次
标准$1.00$1,000
100K 输入命中 Cache$0.55$550
Batch API$0.50$500
Fast Mode$2.00$2,000
美国区域推理$1.10$1,100

这组数字直接说明:

  • 重复的大型 System Prompt 或代码仓库上下文,应该优先做 Prompt Cache;

  • 夜间评测、离线数据处理,应该优先用 Batch;

  • Fast Mode 每月多出的 $1,000,必须由更低延迟带来的业务价值覆盖;

  • “模型价格没涨”不等于“迁移后账单不涨”,因为 thinking 和输出长度可能变化。

再看一个满上下文场景:

1M 输入 + 64K 输出
= 1 × $5 + 0.064 × $25
= $6.60

如果第二次请求的 1M 输入全部命中 Cache:

1 × $0.50 + 0.064 × $25
= $2.10

四、Benchmark:61 分是真的,但 Max 不一定划算

Artificial Analysis 在相同评测体系下测得,Opus 5 Max 的 Intelligence Index 为 61,高于 Opus 4.8 的 56。

EffortIntelligence Index该评测总成本评测输出 Token
Medium56$1,114.9629M
High59$1,973.7752M
Xhigh60$2,909.9176M
Max61$3,835.51100M

注意:表中的钱是 Artificial Analysis 跑完整评测套件的总成本,不是普通用户的月账单。

但是它能用于观察成本曲线:

Max 相对 High 的成本增幅
= ($3,835.51 - $1,973.77) / $1,973.77
= 94.3%
​
分数增幅
= 61 - 59
= 2

也就是说,在这套独立评测里,Max 相比 High 多了 2 分,成本接近翻倍。

因此生产环境更合理的做法是:

  1. 默认从 high 开始;

  2. 用真实任务测试 medium 是否能保持验收率;

  3. 只有 High 失败且任务价值很高时,才升级到 xhigh

  4. max 留给最难、失败代价最高的任务。

独立数据来源:

五、官方 Benchmark 和独立评测要分开看

Anthropic 官方给出的结果很强,但仍属于 Vendor Claim。

测试官方结果证据级别
Frontier-Bench v0.1超过 Opus 4.8 两倍,且单任务成本更低Vendor claim
CursorBench 3.2Max 与 Fable 5 峰值差距小于 0.5%,单任务成本约一半Vendor claim
ARC-AGI 3得分约为第二名的 3 倍Vendor claim
AutomationBench同成本下通过率约为第二名的 1.5 倍Vendor claim
OSWorld 2.0以略高于三分之一的成本超过 Fable 5 最好结果Vendor claim

Artificial Analysis 的独立结果包括:

测试Opus 5 结果对比
Intelligence Index,Max61Fable 5 为 60,GPT-5.6 Sol 为 59,Opus 4.8 为 56
GDPval-AA v21861 Elo比 Fable 5 和 GPT-5.6 Sol 高 100 Elo 以上
AA-Briefcase1720 Elo比 Fable 5 高 146 Elo

这并不表示第三方评测绝对正确。它只表示证据来源不同:

  • 官方价格和 API 规格,可以直接当 Confirmed;

  • 官方 Benchmark,只能当已确认的厂商声明;

  • 独立 Benchmark,是第三方测量,但仍受其 Prompt、Agent Harness 和评分方法限制。

六、Python 接入示例

Opus 5 默认开启 thinking,不需要显式传入 thinking 字段。

import anthropic
​
client = anthropic.Anthropic()
​
response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,
    output_config={
        "effort": "high"
    },
    messages=[
        {
            "role": "user",
            "content": "定位这个仓库中的根因,修复问题并运行测试。"
        }
    ],
)
​
print(response.content)

cURL 版本:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5",
    "max_tokens": 64000,
    "output_config": {
      "effort": "high"
    },
    "messages": [
      {
        "role": "user",
        "content": "Review this repository change and run the tests."
      }
    ]
  }'

七、最容易踩坑的 HTTP 400

下面这个组合在 Opus 5 中会返回 HTTP 400:

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=64000,
    thinking={
        "type": "disabled"
    },
    output_config={
        "effort": "max"
    },
    messages=[
        {
            "role": "user",
            "content": "Review this pull request."
        }
    ],
)

原因是:

Opus 5 只允许在 high 或更低 Effort 下禁用 thinking。

修复方式二选一:

# 方案 1:保留 disabled thinking,把 effort 降到 high。
thinking = {"type": "disabled"}
output_config = {"effort": "high"}
# 方案 2:保留 max effort,删除 thinking disabled。
output_config = {"effort": "max"}

官方还提醒:禁用 thinking 时,模型偶尔可能把工具调用写进普通文本,或者输出内部 XML 标签。对于大多数应用,保留 thinking、通过降低 Effort 控制成本会更稳。

八、Opus 4.8 迁移检查表

迁移不是只换模型 ID,至少检查以下 8 项。

检查项原因
把模型改为 claude-opus-5使用正式模型 ID
检查 max_tokensthinking 和正文共享输出上限
删除重复的“最终自检”PromptOpus 5 可能过度验证
检查 disabled thinkingxhigh/max 下会 400
记录真实 Effort不同 Effort 成本差异很大
分开统计 Cache Token避免只看总输入 Token
检查工具调用结构thinking disabled 有边缘风险
使用 100-300 个真实任务 Canary公共 Benchmark 不能替代业务验收

Canary 建议记录:

  • 任务验收率;

  • 人工修改次数;

  • 重试次数;

  • Tool Call、JSON Schema 错误;

  • 输入、Cache、thinking、输出 Token;

  • 首次有效结果延迟;

  • 每个成功任务的总成本。

九、该选 Opus 5、Sonnet 5 还是 Fable 5

模型选择应该按任务价值和失败成本分层。

场景建议
普通分类、摘要、客服Sonnet 5 或更便宜模型
复杂代码 AgentOpus 5 High
困难 Debug 升级Opus 5 Xhigh,必要时 Max
最高能力的长程 AgentOpus 5 Max 与 Fable 5 直接对拍
大规模离线评测Opus 5 High + Batch
重复大上下文Opus 5 High + Prompt Cache
极低延迟、用户直接等待先评估 Sonnet;必要时测试 Fast Mode

Opus 5 的短板也很明确:

  • 输出价格高;

  • 深度推理延迟长;

  • Max 的边际收益可能很贵;

  • 默认输出更长;

  • 闭源权重,不能本地部署;

  • 迁移存在行为变化。

十、可用渠道

Anthropic 官方确认 Opus 5 已覆盖:

渠道模型标识状态
Claude APIclaude-opus-5已上线
Amazon Bedrockanthropic.claude-opus-5已上线
Google Cloudclaude-opus-5已上线
Microsoft Foundry平台部署已上线

Fast Mode 当前只在 Anthropic 第一方 Claude API 提供。

截至 2026 年 7 月 25 日核验时,TokenMix 公共模型目录尚未出现 Opus 5,只列出了 Opus 4.8、Opus 4.7、Sonnet 5 和 Fable 5。不要自行构造不存在的路由,也不要假设网关会自动映射。

总结

Claude Opus 5 的升级是真的:

  • 与 Opus 4.8 同价;

  • 100 万上下文;

  • 12.8 万最大输出;

  • 独立 Intelligence Index 从 56 提升到 61;

  • 长程 Agent、代码和知识工作能力明显增强。

但生产建议不是“全部切 Max”。

最稳妥的路径是:Opus 5 High 做 Canary,Medium 测成本下限,Xhigh/Max 只处理 High 失败的高价值任务。

完整英文数据表和来源汇总:

Claude Opus 5 Review 2026: Pricing, Benchmarks, API Changes

更多推荐