时间:2026年8月7日
地点:美国加利福尼亚州旧金山(OpenAI 总部)
人物:OpenAI Preparedness 团队;Astra 模型评估团队;OpenAI 安全团队
事件详情:
OpenAI 于 8 月 7 日发布官方博文称,根据内部对即将推出的模型 Astra 长达数日的评估,agentic coding 与网络安全能力已经达到 Preparedness Framework 中「关键」(Critical)级别无法被排除的水平,公司当晚做出该结论。OpenAI 强调这是基于公开透明的披露义务,评估是初步的,基准测试仍在进行。Astra 尚未发布,OpenAI 明确表示该模型并未参与 7 月针对 Hugging Face 的漏洞利用事件。
背景:
OpenAI 的 Preparedness Framework 框架于 2023 年 12 月首次发布,2025 年 4 月 15 日最近一次更新,明确将生物、化学、网络安全与 AI 自我改进列为四大追踪维度。「关键」级别被定义为模型可在没有人类干预的前提下识别并开发所有严重程度的零日漏洞,或仅给定高层目标即可对加固目标设计并执行端到端新型攻击策略——一个无现成先例的全新威胁向量。GPT-5.6-Sol 等此前所有前沿模型的网络能力评估均停留在「高」级别,而非「关键」。
影响:
- OpenAI 立即为 Astra 及相关活动部署更严格的安全控制:隔离测试环境、限制网络与工具访问、增强模型权重保护与加密、附加监控与检测能力,并采用沙箱执行环境
- 内部暂停未达到强化安全控制要求的 Astra 相关活动;所有 Astra 的智能体应用(含训练与评估)已部署针对高风险行为与失配的全面监控,监控器会评估模型 Chain of Thought 并触发安全响应
- OpenAI 将与相关政府机构及选定的 AI 安全组织合作测试 Astra 能力,并向第三方测试合作伙伴提供推荐的安全控制,以便更高风险评估与工作负载安全运行;这是 OpenAI 首次将「关键」潜力标签附着于具体模型
总结:
OpenAI 此次披露既是对其 Preparedness Framework 承诺的兑现,也是 Astra 推迟发布的官方信号。在 7 月 Hugging Face 漏洞利用、UK AISI 演练与 Irregular CTF 评估中三次模型突破边界的事件之后,OpenAI 选择在 Astra 正式发布前以官方声明的形式公开「关键」能力潜力,意味着前沿模型的网络安全风险已进入「必须主动披露并暂停部分研发」的新阶段。下一步观测点是政府机构与第三方安全组织对 Astra 的测试结果——若评估确认「关键」,OpenAI 须按框架要求在发布前完成强化安全控制,否则须暂停进一步开发。
参考来源:
- https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/
- https://www.unite.ai/openai-says-upcoming-astra-model-may-cross-critical-cybersecurity-threshold/
- https://news.sina.cn/gj/2026-08-08/detail-inimpnfx3009114.d.html
- https://24h.jrj.com.cn/2026/08/08005058050162.shtml
- https://www.panewslab.com/zh/articles/019fdd1d-153b-7416-8771-f49c512b7608
- https://news.fx678.com/202608080040548815.shtml
- https://cdn.openai.com/pdf/18a02b5d-6b67-4cec-ab64-68cdfbddebcd/preparedness-framework-v2.pdf