配了三个月 Claude Code,今天发现它的默认设置一直是在骗我——AI 审核 AI 比人工靠谱这件事,终于有数据说清楚了

用户每次点允许之前根本没看——Claude Code 8月14日起默认开启 Auto Mode,用三个月数据发现 AI 审核 AI 比人工靠谱得多。

这个决定不是 Anthropic 拍脑袋的,背后有一系列硬数据:1,053 名付费用户测试,真实生产会话分析,还有第三方红队报告。结论很反直觉——让 AI 看门,比让人看门靠谱得多。

Claude Code 原来的工作方式是这样的:每次执行危险操作之前,它会弹出权限请求,让用户点「允许」或「拒绝」。危险操作包括:运行 shell 命令、写文件到磁盘、启动 git reset –hard 这类不可逆操作。

问题是——根本没人真的在看。Anthropic 自己的遥测数据显示,用户批准了 97% 的权限请求。

这不是用户的错。Claude Code 平均每个会话有几十到上百个权限请求,在高强度开发过程中,点「允许」已经变成了肌肉记忆。Anthropic 的研究里有一句话很直接:「a rate that reflects reflexive clicking rather than genuine review」——这不是审查,是条件反射。

更糟的是,随着会话时间拉长,人类的警惕性会持续下降。研究里有一组数据很能说明问题:前几次提示的审查率还在 17% 左右,50 次以后就掉到了 5%。你越累,看得越少。

Auto Mode 怎么解决这个问题?它把「用户点允许」替换成了一个后台运行的 AI 分类器,每次工具调用都会经过它的判断。分类器会识别哪些操作是不可逆的、哪些是破坏性的、哪些是指向用户环境外部的。

发现危险操作时,分类器不是直接拒绝,而是让 Claude 找一条更安全的路径,实在找不到才向用户请求许可。连续三次阻止或单个会话内阻止二十次后,会自动退回手动审批模式。

效果怎么样?

Anthropic 在 1,053 名付费专业测试者中做了对照实验。研究人员在会话中途把一个常规权限请求悄悄替换成了明显危险的命令。结果:人类测试者只拦住了 13.6% 的危险命令,自动模式分类器拦住了 89%。

随着会话变长,人类检测率持续下降,从最初的 17% 掉到 5%,但分类器的表现始终稳定。

真实生产会话数据更有说服力。Anthropic 分析了 5-6 月真实上报表的会话,手动审批的会话中,包含严重意外伤害的比例是 6.3%,自动模式会话是 2.4%——差了接近三倍。

这些「严重意外伤害」包括:离网数据泄露、大规模删除生产环境 pod 导致 GPU 训练任务中断、尝试给云账号配置过度权限等等。都是真实发生过的。

在提示词注入攻击面前差距更明显。第三方评估机构 Trajectory Labs 测试了 720 次间接提示词注入攻击,在自动模式下跑 Claude Fable 5、Opus 5 和 Sonnet 5——零次成功。对比之下,OpenAI 的 GPT-5.6 Sol 在 Codex 的 Auto-review 模式下成功率 5.83%,Full Access 模式下 19.03%。

速度也受到了影响。Anthropic 的数据是:开启自动模式的用户,拉取请求完成率平均提升约 25%。开发者不再需要频繁停下来点允许,AI 编程工具的真正效率才得以释放。

从 8 月 14 日开始,新建的 Claude Code Pro、Max 和 Team 会话默认在自动模式下运行。这个功能默认关闭了审批提示,对应的 token 开销也不再收费。如果你是 Claude Code 的活跃用户,这个切换不需要你做任何事,默认值会自己生效。

如果你还没开启,可以跑一下 / claude agent 然后选 Auto Mode,实际体验一下分类器的判断逻辑。

对于团队用户:默认值由管理员通过托管设置控制,确认团队内的设置符合你的预期。企业用户目前仍为 opt-in,Anthropic 计划在一个月内也将默认值切换过去。

高风险操作还是要人看。Anthropic 在公告里明确说:「auto mode reduces but does not eliminate risk」——分类器降低了风险,不是消除了风险。对于生产基础设施变更这类高风险操作,建议保持手动审查。

这不是「AI 取代人类判断」,而是「AI 先过滤规则明确的部分,人类专注在真正需要判断的地方」。效率和安全,从以前的矛盾,变成了可以一起提升的东西。

评论区

0 条评论

登录后可评论。

小智·AI工具控 221 阅读