Claude Fable 5登顶全球AI榜,Anthropic因“隐形护栏“道歉并承诺透明化
时间:美东时间 2026年6月9日(北京时间6月10日凌晨)
地点/主体:旧金山——AI安全导向公司 Anthropic
人物:Anthropic 官方团队;波及方包括 IBM X-Force 研究员 Valentina "Chompie" Palmiotti、Prime Intellect 研究负责人 Will Brown、开源 AI 研究者 Nathan Lambert 等
发生了什么
Anthropic 正式对外发布了其内部最高评级 "Mythos 级" 模型的两个版本:
-
Claude Fable 5 —— 面向所有用户的公开版,也就是"戴着安全嘴套的 Mythos"。定价 10/50(每百万输入/输出 Token),约为 Opus 4.8 的两倍。
-
Claude Mythos 5 —— 解除部分安全限制的完整版,不向公众开放,仅通过名为 Project Glasswing 的专项计划分配给约 200 家经过严苛审核的机构(美国政府部门、关键基础设施运营商、网络安全防御组织、合规生物实验室)。
两者的底层模型架构完全相同,唯一区别在于:Fable 5 加装了一整套独立安全分类器。
性能:真的登顶了
在第三方评测机构 Artificial Analysis 的 Intelligence Index 上,Fable 5 以 64.9 分夺下全球第一,领先第二名(GPT-5.5)约 5 个点,Anthropic 同时占据榜单前两名。在软件工程的硬核基准 SWE-Bench Pro 上,Fable 5 跑出 80.3%,将 GPT-5.5(58.6%)甩开逾 20 个百分点。Stripe 用 5000 万行 Ruby 代码库的迁移任务实测:人类团队需两个月,Fable 5 一天搞定。
安全护栏:怎么设计的——以及怎么翻车的
Fable 5 的安全系统采用两级架构:
|
层级 |
机制 |
作用 |
|---|---|---|
|
第一层 · 探针 |
实时监控模型内部激活状态(activation),对所有流量扫描 |
粗筛——判断是否落入高风险语义 |
|
第二层 · LLM 分类器 |
独立训练的专用分类器做最终裁决 |
细判——确定是否触发拦截 |
三大拦截域:①攻击性网络安全技术;②高风险生物/化学知识;③模型蒸馏/前沿 LLM 开发请求(防竞品"偷能力")。
关键争议点在于降级方式:初始设计中,当分类器命中前三类的蒸馏/前沿-LLM 请求时,Fable 5 不会拒绝、不会通知,而是静默降级——悄悄把回答质量调低(或后台切到 Opus 4.8),用户完全不知道自己面对的已不是满血版。即使是网络安全和生物类触发,早期也只有部分场景给出提示。
研究者炸锅了。Dean Ball 直言:"在不告知用户的情况下降低 ML 研究任务的性能,这令人震惊地带有敌意。"Will Brown 感慨:"感觉像他们在自己爬上去之后把梯子抽走了。" IBM 的 Chompie 甚至发现连"读一篇安全博客"都会触发拦截。
Anthropic 的回应:道歉 + 透明化承诺
Anthropic 在社交平台(@ClaudeDevs)正式表态:
"We made the wrong trade-off and we apologize for not getting the balance right."
(我们做了错误的取舍,为没有把握好平衡道歉。)
并宣布即刻推进两项变更:
-
蒸馏/前沿-LLM 请求的降级从现在起可见——用户会明确看到"已 fallback 至 Opus 4.8"的提示,而非沉默变笨;
-
在 319 页系统卡(System Card)中白纸黑字公开了触发规则的范围与逻辑(第 12 页蒸馏规则、第 58–59 页分类器架构),等于把护栏的"触发条件说明书"交到用户手上。
尽管官方声称平均触发率不到 5%,实际用户体感远高于此(AAI 的跨基准测试记录约 8%–9% 的 fallback 率)。Anthropic 的 Boris 也在社区承认生物/网安误伤问题"正在处理"。
总结
Claude Fable 5 的发布本身就是一件标志性事件——这是"Mythos 级"(Anthropic 内部最高危能力层)第一次以可触摸的形态走到普通用户面前。它的登顶不是刷榜噱头,而是实打实的工程能力跃迁。
但真正值得整个行业咀嚼的,是它的安全交付范式:Anthropic 没有选择传统的"一刀切拒绝",而是用降级替代拒绝、分类器做安检、透明化换信任——这条路虽然在第一天就因为"静默降级"摔了一跤,但其方向指向了一个核心命题——
当前沿 AI 的能力已经强到不能无条件公开时,"可控开放"不是封锁,而是给权力装上可见的锁,并把钥匙的记录交给用户看。
Anthropic 用一次公开的 mea culpa(认错)证明了一件事:透明度不是安全性的敌人,不透明度才是。
更多推荐


所有评论(0)