Claude Code 的 Auto 模式现已成为 Pro、Max 和 Team 计划的默认设置
摘要
Anthropic 将 Claude Code 的自动模式设为默认,并公布人类与 AI 安全对比数据及第三方注入测试结果,作者对此持谨慎乐观态度。
核心要点
- 自 2026 年 8 月 14 日起,auto 模式成为 Claude Code 中 Pro、Max 和 Team 计划的新会话默认设置。
- Anthropic 在 1,053 名付费测试者的实验中,将权限提示替换为危险命令,仅 13.6% 的人类拒绝,而 auto 模式可阻止 89% 的此类操作。
- 第三方机构 Trajectory Labs 测试了 72 种间接提示注入场景,共 720 次攻击尝试,对 Claude Fable 5、Opus 5、Sonnet 5 的 auto 模式全部失败。
- Anthropic 高管 Cat Wu 表示即将发布更多评估,并称“已基本缓解所有攻击”,提示注入和数据外泄风险远低于人类审查员。
- 作者指出,人类确认疲劳是真实问题,但 11% 的 auto 模式漏网案例仍需警惕,尤其是提示注入攻击。
原文佐证
- Only 13.6% of the humans refused that harmful action. Auto mode would have blocked 89% of those actions.
- none of the 720 attack attempts succeeded against Claude Fable 5, Opus 5, or Sonnet 5 running auto mode.
- We’re going to publish some evals in the coming weeks, but we’ve pretty much mitigated every attack.
AI 洞察
这标志着 AI 编程助手从“人工确认”向“自动执行”的关键转变,安全防线正从人转移到模型本身。未来编码 agent 的安全竞争将围绕“自动模式下的稳健性”,而第三方评估与真实攻击测试将成为决定信任度的核心标准。提示注入尚未完全解决,11% 的遗漏率意味着攻击面仍然存在,行业需建立更透明的安全基准。