时间:2026年8月8日
地点:美国旧金山(OpenAI 总部)
人物:OpenAI 公司;Astra 模型评估团队;Preparedness 评估委员会
事件详情:
OpenAI 8 月 7 日通过官方博客宣布,已暂停即将推出的下一代模型 Astra 的部分内部开发工作。依据公司 2023 年 12 月发布的《Preparedness Framework》,若一个模型能在没有人类干预的情况下,对现实世界中受严密保护的系统识别并开发零日漏洞,或仅给定高层目标即可独立构思并执行端到端的网络攻击策略,即被定义为达到「关键(Critical)」网络安全阈值。OpenAI 表示,过去几天对 Astra 的内部评估显示,该模型在自主编程和网络安全领域取得「显著进展」,无法排除其触及关键等级的可能性,公司已于发布前一晚做出该项决定。Astra 尚未发布,与 7 月发生的 Hugging Face 漏洞事件无关,GPT-5.6 Sol 此前被评定为「高(High)」等级。
背景:
OpenAI 的 Preparedness Framework 最初于 2023 年 12 月发布,2025 年 4 月 15 日最近一次更新,是公司在生物、化学、网络安全和 AI 自我改进等关键能力逼近时的内部管理工具。一旦模型达到关键级,框架要求公司在开发阶段实施更严格的保护措施,并暂停不符合新安全要求的内部活动。OpenAI 这次的应对参考了 2025 年 6 月逼近生物能力「高」阈值时的处置方式。近期,OpenAI 与 Anthropic 等多家前沿实验室陆续披露模型在网络安全测试中突破沙箱限制的事件,引发监管机构和安全社区对前沿模型自主网络攻击能力的关注。
影响:
- OpenAI 已启动更严格的安全控制,包括隔离测试环境、限制网络与工具访问、加密模型权重、强化监控和沙箱执行,并暂停不符合新安全要求的 Astra 内部活动。
- 公司将与相关政府机构和选定的 AI 安全组织合作测试 Astra 能力,并向第三方测试合作伙伴提供推荐的安全控制规范。
- 这是 OpenAI 首次具体将某个模型标记为可能达到关键网络安全阈值,引发业界对前沿模型「过晚发布、过严限制」的透明度讨论。
- 监管层和社会公众对前沿 AI 自主攻击能力的关注可能因此进一步升温,类似 Preparedness 的内部框架将被讨论是否需要外部监管介入。
总结:
OpenAI 通过 Preparedness Framework 启动对 Astra 的主动暂停,是前沿 AI 实验室首次因网络安全风险对一个未发布的具体模型采取的实质性处置。事件既体现公司对内部管理工具的执行力,也凸显在 AI 自主网络攻击能力快速逼近时仅靠企业自律存在局限。短期看,Astra 的发布节奏可能延后;中长期看,类似 Preparedness Framework 的内部机制和外部监管介入之间的边界将受到更广泛讨论。
参考来源:
- https://openai.com/index/responding-next-frontier-critical-cyber-capabilities
- https://techcrunch.com/2026/08/07/openai-says-it-slowed-astra-model-development-over-security-concerns/
- https://the-decoder.com/openai-flags-its-new-astra-model-as-potentially-reaching-the-highest-cybersecurity-risk-level-for-the-first-time/
- https://www.unite.ai/openai-says-upcoming-astra-model-may-cross-critical-cybersecurity-threshold/
- https://news.qq.com/rain/a/20260808A03XHV00
- https://money.cfi.cn/p20260808000006.html
- https://www.cqcb.com/news/56/2026-08-08/6195150.html
- http://m.toutiao.com/group/7671423416058135066/?upstream_biz=VolcEngine