Uber 把 AI Agent 的安全监控做成了产品,我跑了一遍发现这不是给大厂用的——这套思路每个团队都该学
大多数团队配 AI 编程工具,第一件事是配 API Key,第二件事是配 prompt,第三件事呢?大多数团队就没第三件事了。AI Agent 在干什么、调用了什么工具、访问了什么文件、有没有做出什么越界操作——这些都是盲区。Uber 的安全团队把这个事情正经做成了一个系统,叫 ADR(Agentic AI Detection and Response),论文刚被 MLSys 2026 接收,已经在生产环境跑着了。
ADR 做了四件事:可观测、基准测试、威胁检测、预防。前三件事开源了,预防那个模块没开源,先说前三件。
可观测这件事是基础中的基础。ADR Sensor 会抓取 AI Agent 的行为数据——调用的工具、执行的命令、访问的文件路径、API 调用的上下文,然后标准化成统一格式上报。支持 Claude Code、Cursor、Codex 这些主流工具,macOS/Linux/Windows 全平台都能跑。说白了就是给 AI Agent 装了个黑匣子,你能看到它到底在干什么,而不是只能看到最终输出。
基准测试这件事有意思。ADR-Bench 包含 303 个任务、133 个 MCP 服务器,覆盖了全部 17 种已知的 Agent 攻击手法。你可以用它来评估自己的 Agent 在面对 prompt injection、工具滥用、权限提升这些威胁时的表现。这个基准不是跑个分就完事了,它会给出详细的检测率和误报率数据,告诉你哪个环节最薄弱。Uber 自己的数据是企业场景下 AI Agent 事故里有相当一部分来自工具调用链的失控,基准测试能帮你提前发现这些漏洞。
威胁检测用的是两层架构。第一层是高召回率的 triage,把所有可疑行为先捞出来;第二层是更深度的 agentic reasoning,对这些可疑会话做进一步分析,确认是真的威胁还是误报。这个分层的思路很实用——不是一上来就全量深度分析,那样成本太高,而是先用轻量级筛选,再用大模型做二次判断,兼顾了效率和准确率。
预防模块没开源,Uber 的说法是 stay tuned。这个我能理解,毕竟真要 block 住危险操作需要和 CI/CD 系统、权限系统深度集成,每个团队的架构都不一样,通用方案不好做。
那么问题来了:这套东西适合我的团队吗?
如果你在用 Claude Code、Cursor 这些工具开发生产项目,并且团队里不止一个人在用——那 ADR 的可观测和威胁检测这两块是你现在就能用上的。Sensor 装上之后,你能看清楚团队里谁在用什么工具、访问了什么代码库、有没有异常行为。ADR-Bench 则适合在做安全评估的时候用,告诉你现在这套 AI 编程工作流的脆弱点在哪。
大多数团队对 AI Agent 的安全认知还停留在”别把 API Key 泄露了”这一步。Uber 这套东西的价值在于,它把 AI Agent 安全从点状的意识变成了体系化的运营。如果你还没开始想这件事,现在最好的切入点就是先装个 Sensor 跑两周,看看你的 AI Agent 到底在干什么。
GitHub:uber/ADR,Sensor 和 Detection 模块都开源了,文档写得很清楚,照着跑就行。
评论区
登录后可评论。