时间:2026年8月8日(公告日),2026年8月14日起生效
地点:美国旧金山(Anthropic 总部)
人物:Anthropic;Trajectory Labs(第三方评估机构)
事件详情:
Anthropic 于8月8日发布公告,宣布自8月14日起,针对 Pro、Max 和 Team 三类订阅用户,将 Claude Code 的默认权限模式调整为自动模式(Auto Mode)。自动模式使用一个独立的 AI 分类器(classifier)实时评估每一次工具调用和 Shell 命令,自动放行安全操作,并拦截破坏性、不可逆或越权的行为,无需用户逐条人工确认。Claude Enterprise、Claude API、Claude Platform on AWS、Amazon Bedrock、Google Cloud's Agent Platform 与 Microsoft Foundry 目前仍保持可选,Anthropic 计划在未来一个月内在上述平台同步把自动模式设为默认选项,并取消相应开销。
背景:
随着编码智能体大规模执行 Shell 命令与浏览器操作,逐条人工审批既低效又不可靠,提示词注入(prompt injection)成为智能体安全的核心风险点。Anthropic 邀请1053名付费测试者参与测试,结果显示传统人工审批模式仅能识别出13.6%的危险命令,而自动模式能识别89%,差距超过6倍。在提示词注入评估中,Trajectory Labs 使用72个场景、每个场景10次测试、共720次攻击尝试,覆盖 Claude Code v2.1.205 与 Codex v0.144.5 两个版本。
影响:
- 智能体安全范式转变:从"人工逐条确认"转向"AI 分类器自动裁决",承认了人类在高频命令审批场景下的注意力局限,把安全判断交给专用模型可能成为编码智能体的行业标准配置。
- 竞品对比数据公开:测试显示 Claude Fable 5、Opus 5 和 Sonnet 5 在自动模式下对720次攻击全部拦截、0次成功;GPT-5.6 Sol 在 Codex 的 Auto-review 模式下攻击成功率为5.83%,在 Full Access 模式下达19.03%。
- 免费移除付费门槛:Anthropic 表示将在企业与云平台侧取消自动模式的相应开销,意味着这项安全能力从增值选项变为基础能力,可能推动同行跟进。
- 开发者需重新评估工作流:默认权限变更将影响现有 CI 脚本与自动化流程,8月14日后新会话行为与此前不同,团队需提前验证敏感操作是否会被分类器拦截。
总结:
Anthropic 还指出,未加额外防护的 bypassPermissions 模式平均攻击成功率为0.09%,而 OpenAI 上周发布的新 Auto-review 版本可能改变上述对比结果。自动模式的价值不仅在于拦截破坏性命令,更在于防止工具调用和浏览器 GUI 使用过程中出现的提示注入攻击——第三方评估显示,OpenAI 模型在浏览器任务上的攻击成功率明显更高。这次默认值调整是编码智能体从"能用"走向"敢放手用"的关键一步,但89%的识别率也意味着仍有11%的危险命令可能漏网,开发者不应因默认开启而放松警惕。
参考来源:
- https://www.ithome.com/0/987/249.htm
- https://9to5mac.com/2026/08/07/psa-claude-code-enabling-auto-mode-as-default-next-week-anthropic-says/
- http://m.toutiao.com/group/7671466975972885044/
- http://m.toutiao.com/group/7671359357535257129/
- https://techno-news.net/2026/08/07/news_53511/
- https://www.toutiao.com/w/1872908743984266/