时间:2026 年 10 月 3 日
地点:美国(Archestra 总部)
人物:Archestra 工程团队
事件详情:
AI 安全初创公司 Archestra 于 2026 年 10 月 3 日正式开源发布 OpenAPPA(Agentic Permissions Policy Algebra),这是一款专为大型语言模型智能体(AI Agent)设计的安全引擎,用于防止数据泄露与提示注入攻击。
OpenAPPA 的核心创新在于其运行在智能体 Prompt 执行循环之外,通过单一配置文件 appa.toml 定义数据源、受众、信任级别和权限,并基于确定性代数强制执行安全策略。每次工具调用前,引擎都会检查数据是否被允许流向目标位置,而非依赖概率性的分类器或 PII 检测器。
在两项主流智能体安全基准测试中,OpenAPPA 表现优异:Bench-Corp(20 个企业多步骤工作流)的攻击成功率为 0%,任务完成率达 89%;OWASP AgentThreatBench(基于 OWASP Top 10 for Agentic Applications 2026)的攻击成功率同样为 0%。作为对比,Claude Code 自动模式攻击成功率为 10%,微软 FIDES 为 31%。
该项目的技术报告已发表于 arXiv,标题为《APPA: Recoverable Information-Flow Control for Real-World LLM Agents》,并被接受在 NeurIPS 2026 Workshop on Agents in the Wild 发表。AgentThreatBench 也已被合并至英国 AI 安全研究院(UK AISI)的 inspect_evals 仓库。
背景:
随着 AI Agent 被广泛应用于企业工作流,数据泄露风险急剧上升。当恶意指令通过提示注入嵌入上下文,或模型产生幻觉导致错误行为时,智能体可能将敏感数据发送至未授权工具或外部地址。传统基于分类器的防护无法追踪跨工具调用的数据流,而即使最优的分类器在数百万次调用规模下仍有约 0.7% 的泄露概率。OpenAPPA 采用确定性执行策略,用代数方法保证每次决策的一致性。
影响:
OpenAPPA 的开源标志着 AI Agent 安全领域出现了首个可证明安全性的防护框架。由于其策略文件(appa.toml)完全声明式、跨平台可移植,且引擎执行不依赖任何网络或文件调用,该方案有望快速集成至 Claude Code、Cursor、Copilot、n8n 等主流 Agent 工具中。OWASP AgentThreatBench 进入英国 AI 安全研究院的官方评估框架,也意味着该基准正在成为行业标准。
总结:
Archestra 开源的 OpenAPPA 通过在智能体执行循环外部署确定性安全策略,在两项权威基准测试中实现 0% 攻击成功率,显著优于 Claude Code 自动模式(10%)和微软 FIDES(31%),为 AI Agent 安全提供了可验证的防护范式。
参考来源:
1. https://www.infoq.com/news/2026/10/open-APPA-zero-security-breach/
2. https://github.com/archestra-ai/OpenAPPA
3. https://keynews.ai/news/new-archestras-openappa-saturates-two-major-security-benchmarks-with-a-50951
4. https://www.brief.news/ai/2026/10/04/openappa-secures-zero-breaches
5. https://pivotnews.ai/five/archestra-s-openappa-reports-0-attack-rate-on-two-agent
6. https://dev.to/anas_hamad_a250d89775e242/open-source-tool-scores-zero-breaches-3ncn







