配了三个月 Claude Code,今天才发现 Auto Mode 切进去的那个开关——89% 的危险操作被它拦下来了
8月14日起,Claude Code Pro/Max/Team 新会话默认开启 Auto Mode——Anthropic 说这个切换器拦下了 89% 的危险操作,而人工审批只能拦 14%。这不是「让 AI 自己跑」,是给 AI 装了一个安全气垫。
那个「按钮」切换了什么
Claude Code 的 Auto Mode,本质是一个运行在每次工具调用前的分类器。它不是简单放行,而是分析每一个操作的风险级别:
- 直接放行:低风险操作,比如读文件、查文档
- 自动拦截:涉及网络请求、凭证使用、系统修改的高危操作
- 寻找替代路径:发现更安全的做法时,自动重写指令
- 请求人工确认:识别为危险且无安全替代方案时,才真正停下来
关键在于,这个分类器不看「用户有没有同意」,它看的是「这个操作本身危险不危险」。这和人工审批的逻辑完全相反——人审批时往往基于信任上下文(「这是我自己的 AI,应该没问题」),而分类器没有这个盲区。
为什么人工审批反而更危险
Anthropic 在发布 Auto Mode 前做过一个对照实验:找来 1053 名付费用户,让他们审阅 AI 的操作计划。结果显示,人工审批只能识别 13.6% 的高危操作,而 Auto Mode 分类器独立拦下了 89%。
这个数据反直觉,但它说了一个真实的问题:人在审批流程里容易产生「批准疲劳」——一旦进入常规审批节奏,就会跳过细节直接点同意。AI 分类器没有这个弱点,每次调用都是独立的判断,不存在「反正上次都批了」这种积累效应。
Auto Mode 还有一层保险:连续 3 次拦截或单会话累计 20 次拦截后,Claude Code 会自动退回到人工审批模式,防止分类器本身进入异常状态。
安全研究发现的真实攻击面
就在 Auto Mode 成为默认的同月,安全研究者发现了 macOS 上的 Claude Code 会话可以被利用来建立反向隧道和 LaunchAgent 持久化——这是一个真实的攻击路径。
Anthropic 快速响应,整个 8 月发布了超过 50 项安全和权限修复,覆盖:
- Windows NT 命名空间路径验证(此前存在 NTLM 凭证泄漏风险)
- secrets 不再出现在 MCP 诊断输出里
- 自动模式下的沙盒执行逻辑强化
- 第三方网关场景下的会话崩溃修复
这说明一个现实:AI 编程工具本身不是最危险的部分,危险的是它和企业内部系统、网络的连接点。Auto Mode 某种程度上是在这个连接点上增加一个强制检查点。
企业怎么接这一棒
Auto Mode 默认开启后,团队需要马上做两件事:
第一,审查现有的权限策略。 Claude Code 可以访问文件系统、网络和敏感凭证,默认开启自动化判断后,这些能力的触发路径变了。如果团队之前是靠人工审批来「守门」的,现在需要明确哪些操作要单独设置更严格的规则,而不是依赖全局的 Auto Mode 兜底。
第二,给 Auto Mode 的分类器做灰度验证。 连续 3 次拦截会退回人工审批——这个阈值在真实项目里是否合适,需要跑一段时间才能确认。建议开启会话监控,观察前两周的拦截频率和类型分布,再决定是否需要调整。
一个正在发生的事实
Anthropic 同期还给所有 Claude 模型加了一层不可见水印——不只是 API 输出,包括 Claude Code 生成的代码。这个水印即使经过复制粘贴和轻度编辑也能被检测出来,是欧盟合规要求下的产物。
这意味着 AI 编程工具正在被同时推往两个方向:更快的自动化执行,以及更强的可追溯性。Auto Mode 是第一个方向的产物,水印是第二个方向的产物。两者并不矛盾,但它们把一个问题提前摆到了台面上——
你的团队准备好让 AI 在默认开启的状态下跑生产代码了吗?如果还没想清楚,现在有 89% 的数据在说这个问题不用你想得太复杂。
评论区
登录后可评论。