ADR Skill:企业级 AI Agent 安全检测与威胁防护框架
是什么
ADR(Agentic AI Detection and Response)是 Uber 开源的企业级 AI Agent 安全系统,通过可观测性、安全基准测试和威胁检测三大能力,保护企业内部 AI 编码工具(Cursor、Claude Code、Codex)和客服 Agent,已在 Uber 生产环境落地,配套论文被 MLSys 2026 接收。
功能与原则
ADR 围绕「观测-评估-检测-防御」四个维度设计:
- ADR Observability:捕获 AI Agent 的意图、工具调用和执行轨迹,覆盖 macOS/Linux/Windows 上的 7+ 款 AI 编码工具,以及内部自动化 Agent 和客服 Agent,统一日志 schema。
- ADR Benchmark:在真实企业环境下测试 Agent 安全性——ADR-Bench 包含 300+ 任务、133 个 MCP 服务器,覆盖全部 17 种 Agent 攻击技术。
- ADR Detection:两级架构实现高效风险检测,高召回 triage 层 + 深度 Agentic 推理层,精准识别可疑会话。
- ADR Prevention:阻止不安全行为(该组件暂未开源)。
认可度
- GitHub Star:约 846(截至 2026-08-05),Trending 当日新增 148 ⭐
- 论文已发表于 MLSys 2026,并附完整幻灯片和 PDF
- Uber 生产环境已部署,Sensor 组件于 2026-07-31 发布 v1.0.0 正式版
链接
GitHub:https://github.com/uber/ADR
原作者
由 Uber 安全团队(Chenning Li、Pan Hu、Justin Xu、Baris Ozbas、Olivia Liu 等)主导,隶属 Uber 企业安全部门,专注 AI Agent 安全攻防研究。
介绍
随着 Claude Code、Cursor、Codex 等 AI 编码工具在企业内部普及,数据泄露、工具滥用、提示词注入等新型攻击面急剧扩大。Uber 安全团队在实际运营中发现,企业现有的 SIEM/SOAR 体系无法理解 AI Agent 的行为语义——一条「读取所有文件」的 Agent 操作,在传统安全日志里只是一串文件 API 调用。
ADR 应运而生。它为 AI Agent 安全构建了完整的方法论框架,从可观测性(理解 Agent 在做什么)、基准测试(在受控环境里评估防御能力)、到实时威胁检测(生产环境中捕捉可疑行为),形成闭环。
开源版本包含三大组件:ADR Sensor(负责从各 AI 编码工具采集遥测数据)、ADR-Bench(133 MCP 服务器 × 303 基准任务的评测集)、ADR Detector(基于双 Agent 架构的检测引擎)。离线红队强化引擎(ADR Explorer)未开源。
特点
- 企业级可观测性:统一 schema 采集 Claude Code、Cursor、Codex 等主流工具的 Agent 行为日志,解决传统安全工具「看不见 Agent」的盲区
- 最全面的 Agent 安全基准:ADR-Bench 覆盖全部 17 种已知 Agent 攻击技术,133 个 MCP 服务器,303 个评测任务
- 双层检测架构:高召回 triage 模型 + 深度 Agentic 推理,兼顾检测速度与准确性
- 生产级落地经验:在 Uber 内部运行多年,直接解决实际问题,不是学术概念验证
- MLSys 2026 学术认可:论文 + 幻灯片全部公开,研究与工程并重
使用方法
安装 Sensor:
pip install adr-sensor
运行检测:
git clone https://github.com/uber/ADR
cd ADR/Detection
uv sync
export ANTHROPIC_API_KEY="..." OPENAI_API_KEY="..."
# 默认检测器:adr(ADR 双 Agent 检测器)
# 无 key 测试模式:--detector llamafirewall
查看完整评测流程:
参考 docs/REPRODUCIBILITY.md,包含膨胀打包基准数据 → 运行检测器 → 绘制图表的全流程。
使用场景与人群
- 目标用户:企业安全团队 / SOC 分析员 / AI Platform 工程师
- 适用场景:企业内部 AI 编码工具(Cursor、Claude Code)的安全监控;AI Agent 上线前的红队评估;MCP 服务器生态的安全基准测试
- 不适合:个人用户在本地单兵作战——这是面向组织和企业的安全基础设施
输入与输出案例
案例 1:检测提示词注入攻击
- Input:ADR Sensor 捕获到一个 Claude Code 会话——Agent 在处理用户提供的文档时,执行了
grep -r "password" .并尝试访问.env文件 - Output:ADR Detector tiggers High Severity 告警,归类为「数据渗出企图」,推送至 SOC,附完整 Agent 操作链轨迹
案例 2:ADR-Bench 安全基准评估
- Input:给定 133 个 MCP 服务器,其中部分包含恶意工具定义(如
steal_credentials),303 个对抗任务 - Output:Baseline 检测率报告,显示 LlamaFirewall 检出率 62%,ADR Dual-Agent 检出率 89%——为企业选择防护方案提供量化依据
GitHub: https://github.com/uber/ADR
评论区
登录后可评论。