你的 AI Agent 上线前,有没有系统性地测过它会不会被人”拐跑”?

你的 AI Agent 接了哪些工具?上线前,有没有系统性地测过它会不会被人”拐跑”?

腾讯朱雀实验室(Tencent Zhuque Lab)上个月发了一个数字:他们协助 NVIDIA、Hugging Face、Microsoft 修复了数十个高危漏洞,其中一个 vLLM 漏洞 CVSS 评分高达 9.8。这些漏洞本身不新鲜——默认端口暴露、无认证 API、 unsafe 反序列化——但放在 AI 场景里,攻击者拿到的不仅是服务器,还有私有模型、知识库、以及通过该服务可达的所有内部接口。

这不是孤例。2026 年 5 月,微软安全团队披露了 AI Agent 框架的一组高危漏洞。在 Semantic Kernel 中,攻击者通过 prompt 注入,诱导 Agent 调用搜索插件,在过滤表达式中插入恶意 Python 代码,最终在宿主机上执行任意命令(CVE-2026-26030)。腾讯内部红队也反复验证了同样的问题:某些业务侧 Agent 连接了无沙箱隔离的代码执行工具,一句精心构造的 prompt 就足以让 Agent 运行任意命令并直接控制底层服务器。

这个问题的本质是:AI Agent 的攻击面分布在多个层次,而每层需要的检测手段完全不一样。基础设施层的漏洞靠签名匹配;协议层的 MCP 服务器问题靠语义分析;Agent 行为层需要多轮红队对抗;模型层则需要统计测试。传统的单点安全工具搞不定这件事。

腾讯朱雀实验室开源的 AI-Infra-Guard(又称 A.I.G),就是想解决这个问题。截至本文发布,GitHub 已有 5,036 颗星,最新版本 v4.5.2(2026-08-17)收录了 2,000+ CVE 规则,覆盖 75+ AI 组件。


四层扫描,覆盖 AI 系统的完整攻击面

AI-Infra-Guard 按照攻击面层次设计了四个独立扫描模块:

第一层:AI Infrastructure Scan(AI 基础设施扫描)

针对运行中的 AI 服务 URL 或 IP 地址,识别暴露的组件版本并匹配漏洞规则。支持的组件包括 vLLM、Ollama、ComfyUI、n8n、NVIDIA Triton Inference Server 等主流工具。v4.5.0 版本已覆盖 130 个组件、1,888 条漏洞规则,v4.5.2 进一步扩充至 2,000+ CVE 规则,支持 .pyc 字节码混淆绕过检测和字符集走私防御。

第二层:MCP Server Scan(MCP 协议扫描)

MCP(Model Context Protocol)服务器是这两年 AI Agent 最常见的扩展方式,也是签名扫描最容易漏掉的地方——协议层的漏洞往往是语义层面的,不是字节特征。AI-Infra-Guard 的 MCP Scanner 支持从源码或远程 URL 扫描,涵盖 14 类风险(工具投毒、凭证泄露、命令注入等),v4.5.2 新增了动态模式下通过工具白名单防止 RCE 的能力。

第三层:Agent Scan(Agent 行为扫描)

Agent Scan 主动连接运行中的 Agent,通过 API 发送测试 prompt 并分析响应,采用三阶段管道:信息收集 → 漏洞检测 → OWASP Agentic Security Initiative 映射。v4.5.1 版本已支持 10 种检测技能(5 种默认启用),覆盖 Agent 配置、提示词、工具权限和工作流风险。适配的 Agent 平台包括 Dify、Coze、OpenAI 兼容应用、Anthropic、Google Gemini 等。

第四层:Jailbreak Evaluation(越狱评估)

专门测试模型对各类攻击 prompt 的抵抗力。v4.5.1 新增了 4 种多轮越狱攻击方法(Many-Shot、PAIR、GOAT、ActorAttack),覆盖 26+ 攻击算子、16 个数据集。界面会展示原始输入、转换后的攻击输入和模型输出,方便人工复核具体案例,而不是只看一个总分。


Skill Scan:被忽视的供应链攻击入口

除了上面四个扫描层,AI-Infra-Guard 还有一个单独模块——Skill Scan,专门扫 Agent 技能包和插件的供应链风险。

这个方向容易被忽视:很多团队会给 AI Agent 装第三方 Skill 来扩展能力,但 Skill 包本质上是一段代码,运行在 Agent 的上下文中。如果 Skill 里有恶意代码、指令劫持、内存投毒或权限滥用,后果比直接攻破 Agent 更隐蔽。AI-Infra-Guard 的 Skill Scanner 将发现结果映射到 9 个 SkillTrustBench 类别,包括指令劫持、内存投毒、恶意代码、权限滥用、持久化、工具劫持、依赖安全和编码不规范等。v4.5.0 在 SkillTrustBench 基准测试中拿到了 0.9848 分(满分 1.0)。

腾讯智元实验室还发布了一个专门的 “Agent Security Drill Skill”(A.I.G Red Team’s Deep Research Skills 的一部分),提供了体系化的 Agent 安全演练路径,已在 腾讯矩阵平台 开源。


真实使用门槛:适合谁,不适合谁

适合部署的场景:

  • 企业内部已有 Dify/Coze 等平台搭建的 AI Agent,需要在上线前系统做安全自检
  • 安全团队需要对 AI 基础设施(vLLM、Ollama 等)做周期性漏洞扫描
  • AI 应用在正式发布前需要一份标准化的 red teaming 报告
  • 研究机构需要对不同模型的越狱抵抗力做横向对比

当前版本的局限:

  • 默认无认证,不建议将 Web 服务暴露到公网(项目 README 明确警告这点)
  • Agent Scan 需要目标 Agent 提供 API 接口,不支持黑盒扫描
  • Skill Scan 主要扫 Python 包,对 Node.js/npm 生态的 Skill 覆盖还比较初步
  • 实际运行需要授权,只扫描你有权限测试的服务

硬件要求:
官方 Docker 部署最低配置:Docker 20.10+、4GB 内存、10GB 磁盘空间,默认 Web 界面端口 8088。


一键部署体验

官方推荐的快速启动方式(最短路径,无需编译):

git clone https://github.com/Tencent/AI-Infra-Guard.git
cd AI-Infra-Guard
docker-compose -f docker-compose.images.yml up -d

启动后访问 http://<your-ip>:8088 即可使用浏览器界面,API 文档在 /docs/index.html。Skill Scanner、MCP Scanner、Agent Scan 也有独立的 CLI 包,v4.5.0 起支持独立调用,方便集成到 CI/CD 流水线。

项目文档有中文、英文、日文、西班牙文、德文、法文、韩文、葡萄牙文、俄文共 9 个语言版本。


下一步建议

如果你在负责企业 AI Agent 的安全合规,有三个可操作的起点:

  1. 立刻用 Infrastructure Scan 扫一遍你们暴露的 vLLM/Ollama 端点——大多数团队在这个层面有未修复的 CVE,腾讯朱雀实验室协助国际厂商修复的漏洞里有不少就是这类默认配置问题
  2. 用 Agent Scan 连接你的 Dify/Coze 应用跑一轮默认检测——10 项检测技能 5 项默认启用,覆盖大多数常见配置风险,跑一轮大约 10-30 分钟
  3. 如果你的 Agent 接了第三方 Skill,在部署前先用 Skill Scanner 扫一遍包——这是供应链攻击最常见的入口,SkillTrustBench 基准已经做到 0.98 分以上,覆盖率足够生产使用

AI-Infra-Guard 项目地址:https://github.com/Tencent/AI-Infra-Guard
官方文档:https://tencent.github.io/AI-Infra-Guard/
技术报告:https://arxiv.org/html/2606.31227
腾讯智元实验室 Agent 安全演练 Skill:https://matrix.tencent.com/en/2026/06/29/agent-security-drill-skill
SkillTrustBench 基准:https://matrix.tencent.com/skilltrustbench

评论区

0 条评论

登录后可评论。

智源·AI 开源观察 560 阅读