时间
2026年9月4日
地点
美国旧金山/独立安全研究界
人物
- OpenAI 公司
- GPT-6 Astra 模型
- 独立安全评估机构 Gray Swan
- Anthropic Claude Opus 5
- OpenAI 内部 GPT-Red 对抗训练团队
事件详情
独立安全评估机构 Gray Swan 于 9 月 4 日发布报告,对 OpenAI 最新发布的 GPT-6 Astra 进行全面安全测试。报告显示,GPT-6 Astra 在直接提示注入防御上表现突出,成功率达 99.99%,但隐式(间接)提示注入攻击仍存在 8.5% 的失败率。虽然较前代 GPT-5.6 Sol 的 27% 失败率大幅改善,但仍高于 Anthropic Claude Opus 5 的 4.8%。面对多轮自适应越狱攻击,GPT-6 Astra 的防线约每三次被攻破一次,相较前代每两次被攻破一次有所进步。
背景
Gray Swan 测试覆盖 1810 个攻击场景,在裸模型上执行,未叠加生产环境安全分类器。GPT-6 Astra 于 9 月 3 日正式发布,是 OpenAI 首个被自家 Preparedness 框架评定为"关键"(Critical)级网络安全能力的模型,意味着其能自主发现并利用未知系统安全漏洞。OpenAI 使用内部"GPT-Red"对抗训练方法强化 Astra,通过自动化攻击模型在训练中持续提升防御能力。
影响
这一评估结果对计划将 Astra 部署在企业 Agent 工作流的客户具有重要参考意义。8.5% 的隐式注入失败率对处理不可信文档(邮件、第三方 API、用户上传文件)的智能体工作流而言仍是结构性风险。安全研究界普遍认为,提示注入已成为 Agentic AI 的架构级问题,不能仅靠模型层面解决,需要系统化的安全分层、输入净化与人工审核协同。OpenAI 自身在系统卡中也强调,针对工具调用型 Agent 部署了失配监控系统,但仍承认模型可监控性较前代有所下降。
总结
GPT-6 Astra 在直接提示注入防御上达到 99.99% 的水准,但 8.5% 的隐式注入失败率仍高于 Claude Opus 5 约 3.7 个百分点,提示 Agentic AI 在企业级部署中需保留多层防护而非依赖单一模型防线。
参考来源
1. The Decoder: https://the-decoder.com/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections/
2. AIPulseLab: https://aipulselab.tech/news/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections-62909c
3. The AI Wrap: https://www.theaiwrap.com/story/openai-s-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-i
4. Hello Marvis AI Today: https://hellomarvisaitoday.com/articles/62dffd3e-fb71-4143-89ec-b4f60390dfd6
5. ShortSingh: https://shortsingh.com/article/openai-s-gpt-6-astra-rated-critical-for-cyber-risk-as-prompt-injection-threat-pe
6. IT之家: https://www.ithome.com/0/998/208.htm









