Claude 5.1 来了:价格没涨,账单却变了
2026年9月1日,Anthropic 悄悄发了一次"点版本"更新——从 Fable 5 到 Fable 5.1。名字听起来像小修小补,很多人第一反应可能是"又是挤牙膏式更新",但细看发布内容会发现,这次更新的信息密度其实不低,只是关键信息都埋在不起眼的地方,需要拆开来看。
这次发布了什么?
Anthropic 同时推出了两个模型:
- Claude Fable 5.1:面向所有用户开放,官方称其为"全球最先进的编程与知识工作模型"
- Claude Mythos 5.1:底层权重与 Fable 5.1 相同,但安全限制更宽松,仅面向通过审核的网络安全、生命科学团队开放(邀请制)
这种"一个模型两幅面孔"的发布方式其实不是第一次出现了——之前的 5 代也是这个套路。个人理解是,Anthropic 在用这种方式解决一个矛盾:一方面模型能力越强、越有科研和安全价值的潜力,另一方面这种能力本身也越敏感(比如生物、网络安全相关任务)。与其做一个"阉割版通用模型",不如做两条线:大众版做安全兜底,专业机构版走审核开放权限,这样既不耽误普通开发者用最新能力,也给了高敏感场景一个合规的入口。

一、跑分:这次是真的涨了
Fable 5.1 在多个基准测试上的表现相当亮眼:
| 测试项目 | Fable 5 | Fable 5.1 | GPT-5.6 Sol |
|---|---|---|---|
| Terminal-Bench-Science 0.1 | 24.7% | 52.6% | 22.4% |
| Terminal-Bench 4.0(代码工程) | 42.0% | 55.8%(Mythos版60.9%) | — |

值得一提的是,在 Anthropic 公布的对照测试中,Fable 5.1 已经全面反超自家的 Opus 5——此前 Opus 5 领先的几项测试,这次也被 Fable 5.1 拿下(Terminal-Bench 4.0 领先约3.5分,AutomationBench 领先约4.5分,CursorBench 3.2.0 领先约3.4分)。
我自己看这份跑分单时,第一反应不是"翻倍了好厉害",而是"翻倍的到底是哪种任务"。仔细看会发现,涨幅最夸张的 Terminal-Bench-Science,测的是那种需要连续跑几十步、中途还要自己判断"这条路走不通、换一种方法"的科研型任务,而不是单轮问答或者一次性代码生成。
这类任务过去恰恰是大模型的软肋——不是不会写代码,而是"跑着跑着就跑偏、跑崩"。所以与其说这次是"模型变聪明了",不如说是"模型变得更能扛住长任务里的自我纠错",这个能力提升对日常聊天用户几乎无感,但对做 Agent、跑自动化流水线的人来说,是实打实的可用性提升。选择跟哪个基准对比、怎么设置测试条件,官方公告的话语权很大,跑分好看不代表所有场景都好用。
二、价格没变,但账单会变
这是这次发布里最容易被忽略、但影响可能最大的一点:
- 输入/输出价格完全没变:仍是 $10 / 百万输入token,$50 / 百万输出token
- 但缓存读取价格从 $1.00 降到 $0.25,降幅75%

对普通聊天用户来说这条更新感知很弱,但对长时间跑的 Agent 任务(比如反复读同一份代码仓库、同一段系统提示词)影响很大——因为这类任务里,大部分输入 token 其实都是缓存命中。Anthropic 官方给出的数据是:普通场景下能省约25%,高强度 Agent 任务最高能省45%。
这一条我个人觉得是整份公告里"性价比"最高的信息,但也是最容易被大众媒体忽略的一条——因为它不是那种"跑分翻倍"式的吸睛数字,而是藏在价格表的一个脚注里。但如果你算一笔账就会发现问题不小:一个跑几十轮的 Agent 任务,每一轮都要把系统提示词、文件树、历史对话重新塞进上下文,这部分内容在多轮之间几乎不变,全靠缓存命中省钱。缓存价格降到原来的四分之一,意味着"跑得越久、越省",这其实是在鼓励开发者把 Claude 用在更长周期的自动化任务上,而不是零散的单次调用——某种程度上,这也是 Anthropic 在用定价策略,引导整个生态往"长任务 Agent"方向走,而不只是升级一下聊天体验。对国内做 SaaS 或者接 API 二次开发的团队来说,这条更新可能比跑分数字更值得关注和测算。

这个案例被官方放进 Mythos 5.1 的生命科学/科研成果展示中,作为"模型能亲自做研究"的例证。
这类案例每次新模型发布都会出现一两个,与其说是给普通用户看的功能演示,不如说更像是给科研机构、投资人看的"能力信号"——潜台词是"这个模型不只是能写代码、写文案,还能处理真正需要专业判断的科研数据"。金星地形图这个案例选得也挺巧妙:用的是30年前的老数据,没有新增任何观测成本,纯靠算法把旧数据"榨"出更高精度的信息,这种"用现有数据挖出增量价值"的叙事,比单纯秀一个跑分数字更容易让非技术背景的读者理解模型到底强在哪。写公众号文章时,这一段其实很适合作为"如果只让读者记住一件事"的记忆点,因为它比价格表和跑分表都更有画面感、更容易被转发。

四、安全方面的小变化
官方还提到一项反滥用措施:2026年8月31日之后新注册的 API 账号,无法在对话过程中手动修改上下文来提取模型的思维链(CoT)——尝试这么做会直接报错,或触发思考内容被清空。这被解读为针对"蒸馏"竞品模型行为的防御措施,官方表示后续新模型会对全账号强制生效。
这条更新看似技术细节,背后其实是行业里一个越来越明显的趋势:头部大模型公司开始把"防止自家模型被拿去蒸馏训练竞品"当成正经的产品设计问题来对待,而不只是靠服务条款口头约束。之前业内已经有不少关于"用大模型输出去训练小模型、甚至训练竞品模型"的争议,这次 Anthropic 直接在工程层面做限制,某种程度上说明这类风险已经从"理论上存在"变成了"值得专门写进发布公告"的现实问题。对普通开发者影响不大,但如果你的业务恰好涉及大量调用模型输出做二次处理或者训练自己的模型,这条更新值得留意一下账号注册时间和相关条款的变化。
结语
总的来看,Fable 5.1 不是一次"参数堆料"式的升级,价格没涨、上下文窗口也还是1M token,真正的变化藏在两个不太起眼的地方:缓存降价(改变了长任务的实际成本结构)和长程任务能力(几项跑分翻倍,反超自家 Opus 5)。如果非要用一句话总结这次发布的调性,大概是"这次更新不是做给普通用户看的,是做给正在认真跑 Agent、跑自动化流程的人看的"——跑分故事讲得漂亮,但真正决定要不要升级的,其实是价格表里那一行不起眼的缓存费率。如果你主要用 Claude 做日常问答或短文写作,这次更新对你影响不大;但如果在跑 Agent、做长代码工程或大规模文档分析,这次更新值得认真评估一下,甚至值得拿自己的真实工作流跑一次成本对比,而不是只看官方给的"最高省45%"这类峰值数字。

更多推荐





所有评论(0)