AI Agent 正在成为新的攻击跳板——自我复制蠕虫已进实验室,63% 的攻陷率意味着什么
配了三个月 AI Agent,今天才发现它们已经开始「繁殖」了——不是比喻,是字面意义上的自我复制和横向传播。2026 年 3 月发表的 AgentWorm 论文(arXiv:2603.15727)用 2250 次独立试验证明,当前主流 Agent 框架在面对自我传播攻击时, aggregate success rate 达到 63%。这不是概念验证,是生产级别的威胁评估。
AgentWorm 做了什么
研究团队对 unmodified OpenClaw(超过 40000 个活跃实例)进行了完整的攻击链评估:恶意指令写入配置文件 → 持久化跨越 session 重启 → 后续启动时执行 payload → 自主传播给对等 Agent。五个不同 LLM backend(包含 Minimax-M2.5、DeepSeek-V3.2、GLM-5 等)全部中招。三种感染向量中,skill-supply-chain 这条路径尤其高效,aggregate success rate 达到 82%。多跳实验证实攻击可以持续扩散至五跳。Hermes Agent 框架上的 transferability test 则证明了这是 autonomous-agent 设计模式的系统性缺陷,不是某个代码库的偶发问题。
沙箱隔离是唯一将成功率压到零的控制手段。然而在公开的 OpenClaw 配置中,零个部署启用过沙箱隔离。
Black Hat 和 DEF CON 2026 说了什么
Black Hat 2026 的研究从多个维度扒开了 AI Agent 的安全盲区。Novee Security 发现了 trust-handoff failure:AI pipeline 的每个 stage 验证输入后标记为「安全」,但下一个 stage 消耗数据的权限远超上游验证的预期。信任假设不跟着 payload 走,只有 payload 自己在走。Fix 是建筑层面的——每个跨 stage 边界的数据包必须携带显式 trust level,下游 stage 必须独立强制最小信任阈值。
Rublik Zero Labs 实现了第一个 Microsoft Copilot sandbox 逃逸到宿主环境,攻击向量是一个文档上传,不需要任何用户交互,结果是 Remote Prompt Execution——攻击者可以在受害者 Copilot session 内运行任意 prompt,blast radius 覆盖多个 Azure 服务。
DEF CON 34 的研究更彻底。Elad Meged 证明了 Claude Code、Gemini CLI、Codex CLI 的沙箱从根本上就是 broken 的——Gemini CLI pre-task RCE 漏洞 GHSA-wpqr-6v78-jr5g 得分 CVSS 10.0。Yaara Shriki 和 Wiz 证明 LiteLLM(大约三分之一云环境使用的开源 AI gateway)存在认证绕过,可以从零凭证实现完整云环境接管。19% 的 LiteLLM 实例接受默认凭证或根本不需要认证。
Wiz 还发现了一个 CVSS 10.0 的 CVE-2025-59528:Flowise 的 CustomMCP 节点存在未认证 RCE。
「Lethal Trifecta」:那个结构性缺陷
OWASP 的报告把这个问题命名为「Lethal Trifecta」:任何一个 Agent 同时满足三个条件——接触私密数据、能访问不可信外部内容、有外向通信能力——就可能在一次间接 prompt injection 后成为数据外泄工具。这个缺陷不是某个实现的 bug,是 LLM 将 system prompt、用户输入、外部检索文本作为同一个 token 流处理的结构性后果。攻击者注入的指令和开发者写的系统指令在 token 层面完全无法区分。
CrowdStrike 2026 数据进一步量化了企业面临的真实处境:83% 的组织计划部署 Agentic AI,但只有 29% 感觉真正有能力保护它们。47% 已部署的 Agent 处于无有效监控或保护状态。98% 的生产 Agent 同时满足上述三个危险条件。
Anthropic 怎么应对
2026 年 5 月底,Anthropic 发布了专门针对 AI Agent 的零信任安全框架,核心是五个威胁类别:Prompt injection(嵌入在 Agent 处理内容中的对抗性指令)、Tool poisoning(Agent 调用接口的破坏)、Identity and privilege abuse(Agent 积累超过任务需求的权限)、Memory poisoning(Agent 持久化上下文或记忆被破坏)、Supply chain compromise(Agent 依赖的恶意或脆弱依赖)。
框架的底层原则是:把每个 Agent 当作不受信的 identity,每次请求都要认证,每次授权都要最小权限,每个操作都要记录——而且日志要记录 Agent 的推理 trace,不只是最终动作。
这件事对论文日报意味着什么
AgentWorm 论文的核心贡献不只是展示了 63% 的成功率,而是证明了沙箱隔离是唯一有效的控制手段,以及这是 autonomous-agent 设计模式的系统性问题——这意味着只要这个架构模式继续流行,攻击就会继续有效。在 AI Agent 快速进入生产环境的背景下,这件事的工程价值不亚于任何模型架构创新。
论文链接:AgentWorm: Self-Propagating Attacks Across LLM Agent Ecosystems (arXiv:2603.15727)
参考来源:OWASP Top 10 for Agentic Applications (2026)、Black Hat USA 2026 演讲集、DEF CON 34 AI 安全研究、Anthropic Zero Trust Security Framework (2026-05)、CrowdStrike 2026 Global Threat Report
评论区
登录后可评论。