Auto 模式现已成为 Claude Code 在 Pro、Max 和 Team 套餐中的默认模式
摘要
Anthropic 自 8 月 14 日起将 Claude Code 的 Auto 模式设为 Pro、Max 和 Team 套餐的默认选项,并公布安全测试数据,声称其能比人类审批更有效地拦截危险操作与提示注入攻击。
核心要点
- 2026 年 8 月 14 日起,Claude Code 在 Pro、Max 和 Team 套餐的新会话默认启用 Auto 模式。
- Anthropic 内部几乎全员使用 Auto 模式;Cat Wu 称即将发布评估,并称已基本缓解提示注入和数据外泄等主要风险。
- 在一项涉及 1,053 名付费测试者的实验中,将权限提示替换为明显危险命令后,仅 13.6% 的人类拒绝;Auto 模式预计可拦截其中 89% 的操作。
- 委托第三方 Trajectory Labs 评测(截至 2026 年 7 月 17 日版本),涵盖 72 个间接提示注入场景、共 720 次攻击;Claude Fable 5、Opus 5 和 Sonnet 5 在 Auto 模式下全部成功防御。
- Simon Willison 认为 Auto 模式优于人工审批(确认疲劳是真实问题),但提醒仍有 11% 的情况 Auto 模式无法预防。
原文佐证
- Only 13.6% of the humans refused that harmful action. Auto mode would have blocked 89% of those actions.
- In this evaluation, none of the 720 attack attempts succeeded against Claude Fable 5, Opus 5, or Sonnet 5 running auto mode.
- We commissioned an evaluation from a third party, Trajectory Labs, who tested different models within the latest publicly available versions of Claude Code and Codex as of July 17th 2026.
AI 洞察
这标志着 AI 编程代理从“人工逐次确认”向“自主默认执行”的关键转变,Anthropic 试图用数据证明自主模式不仅更高效,而且比人类监督更安全。如果这些评估能经得起复现,竞品将被迫跟进同等级别的自主安全评测,提示注入的攻防也会成为编程工具的核心竞争力。未来,人类审批可能不再作为安全闸门,而是退化为处理少量高风险操作的合规仪式;真正的安全将依赖模型内生防御和持续的外部红队测试。