摘要:Anthropic 宣布自 2026 年 8 月 14 日起,Claude Code 的默认权限模式将从「手动审批」切换为「自动模式」。内部测试数据显示,自动模式可拦截 89% 的危险命令,而人工审批仅能拦截 13.6%。同时,Anthropic 还引入了提示词注入筛查、可自定义硬性拒绝规则等多层安全防护机制,将间接提示注入率降至趋近于零。



一、发生了什么?

2026 年 8 月 8 日,Anthropic 通过官方博客和社交媒体渠道正式宣布:自 8 月 14 日起,Claude Code 将把「自动模式」(Auto Mode)设为 Pro、Max 和 Team 套餐用户的默认权限模式,企业客户可选择手动开启。

这一变化意味着,Claude Code 在执行 shell 命令和文件操作时,将不再默认弹出人工审批对话框,而是由一个独立的分类器(Classifier)在后台实时评估操作的安全性。只有当操作被判定为"不可逆、具破坏性或超出环境范围"时,系统才会请求用户手动确认。

此前,Claude Code 的默认行为是:每次执行高风险操作时都会弹窗让开发者审批。从 Anthropic 公布的内部测试数据来看,这种依赖人工审批的机制效果远不如预期


二、一组令人震惊的数据

Anthropic 在 1,053 名付费测试者中进行了对照实验,结果令人深思:

指标

手动审批模式

自动模式

危险命令拦截率

13.6%(另有来源称 14%)

89%

拦截效率提升

约 6.5 倍

间接提示注入率

未公布

趋近于零

也就是说,在手动审批模式下,开发者面对弹窗时 有约 86% 的危险操作被直接放行

这个数据揭示了一个残酷的现实:开发者在高频编码流程中容易产生"审批疲劳"(Approval Fatigue) ——面对频繁弹出的确认对话框,人会本能地选择"允许",甚至不再仔细阅读命令内容。自动模式用独立的机器学习分类器替代了这种不靠谱的"人肉审查",在大量测试中表现出色。


三、多层安全防护:间接提示注入率趋近于零

除了命令审查分类器,Anthropic 在安全架构上做了更深层的设计。Boris Cherny(Anthropic 工程师)在 X(原 Twitter)上透露:

"事实证明,只要叠加足够多的防护层——模型训练 + 输入探测 + 检查意图的分类器——就能在未见过的攻击上把间接提示注入率降到接近 0。一年前我没想到能做到这点。"

四层防护体系:

  1. 模型训练层:基础模型在训练阶段即学习识别恶意指令模式
  1. 输入探测层:对所有输入进行实时扫描,检测提示注入特征
  1. 意图分类器:独立于主模型的分类器,专门判断操作的真正意图是否恶意
  1. 硬性拒绝规则:用户可自定义的拒绝规则,对特定类型的操作直接拦截

这四层防护协同工作,使得即使是未曾见过的攻击手法也能被有效拦截。这在当前的 AI 编程助手领域属于领先水平。


四、新增安全功能一览

除了默认启用自动模式,本次更新还带来了以下安全增强:

1. 提示词注入筛查(Prompt Injection Screening)

新增独立的提示词注入检测模块,对所有传入 Claude Code 的上下文内容(包括代码文件、注释、第三方库文档)进行实时扫描,防止恶意构造的内容诱导模型执行危险操作。

2. 可自定义硬性拒绝规则(Customizable Hard Reject Rules)

开发者或团队管理员可以配置硬性拒绝规则:一旦操作匹配预设模式,无论分类器判断结果如何,都将被直接阻止。例如:

  • 禁止 rm -rf /
  • 禁止修改 /etc/ 下的系统文件
  • 禁止向外部域名发送敏感数据

3. 企业级控制

企业客户可以独立配置自动模式的开启范围,并在组织层面统一管理安全策略。


五、事件时间线

时间

事件

8 月 8 日 02:42

Claude Devs 官方账号首发公告,宣布自动模式将成为默认设置

8 月 8 日 07:16

Boris Cherny 在 X 上透露多层防护将间接提示注入率降至趋近于零

8 月 8 日 23:12

The Decoder 深度报道自动模式的分类器技术细节

8 月 9 日 06:56

Simon Willison 博客转载分析,引发开发者社区广泛讨论

8 月 9 日 11:00

事件热度达峰值(热度指数 40)

8 月 10 日 03:44

TechCrunch 发布综评,覆盖完整数据与新功能

8 月 14 日(即将)

自动模式正式成为 Pro / Max / Team 套餐的默认选项


六、这对开发者意味着什么?

对个人开发者(Pro / Max)

  • 体验变化:日常编码中审批弹窗将大幅减少,流程更流畅
  • 安全隐患:不需要手动审批 ≠ 不需要关注安全。建议不要完全关闭自动模式的拦截提示,尤其是涉及数据库、生产环境等敏感操作时
  • 建议:花时间配置硬性拒绝规则,针对自己的项目环境做自定义安全策略

对团队(Team / Enterprise)

  • 管理优势:团队管理员可以在组织层面统一安全策略,减少因个别成员误操作导致的事故
  • 合规需求:如果团队有严格的审计要求,建议保留部分手动审批环节作为补充
  • 建议:先在测试环境中充分验证自动模式的行为,再推广到全团队

对行业

Claude Code 的这一举措再次拉高了 AI 编程助手的安全标准。GitHub Copilot、Cursor、Windsurf 等竞品是否会跟进类似机制,值得关注。


七、一些思考

从 13.6% 到 89%,这不是一个简单的功能迭代,而是对"人 vs 机器在做安全审查时谁更可靠"这个问题的实证回答

开发者审批疲劳是真实存在的工程心理学问题。当 AI 编程助手越来越深入开发流程,弹窗审批的边际效用会持续递减——一天审批 50 次和审批 500 次,人的注意力水平完全不同。用机器学习模型来做第一道防线,把人从重复的审批中解放出来,同时把人的判断力保留在最关键的决策节点上,这是一个聪明的设计选择。

当然,89% 的拦截率也意味着仍有 11% 的危险操作可能漏网。自动模式不是一个"设完就忘"的开关,而是需要与开发者的安全意识、团队的管理策略配合使用的工具。


八、总结

维度

要点

核心变化

Claude Code 默认权限模式从手动审批 → 自动模式(8月14日起)

覆盖范围

Pro / Max / Team 用户默认开启;Enterprise 需手动启用

关键技术

独立分类器实时审查 shell 命令和文件操作

效果数据

危险命令拦截率从 13.6% 提升至 89%(约 6.5 倍)

新增功能

提示词注入筛查、可自定义硬性拒绝规则

间接注入

多层防护协同,间接提示注入率趋近于零


 如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。

  1. Claude Devs 官方公告(@ClaudeDevs, X, 2026-08-08)
  1. Boris Cherny 技术解读(@bcherny, X, 2026-08-08)
  1. TechCrunch: "Anthropic makes Claude Code's auto mode the default"(2026-08-10)
  1. Simon Willison's Blog: "Claude Code defaults to Auto mode for Pro, Max, and Team plans"(2026-08-09)
  1. The Decoder: "Anthropic makes Claude Code Auto Mode default to prevent developers from accidentally approving dangerous operations"(2026-08-08)

本文由 AI 辅助撰写,数据来源为 Anthropic 官方公告及多家科技媒体报道。

更多推荐