时间:2026年9月4日(北京时间上午),OpenAI 通过闭门媒体沟通会正式发布旗舰模型 GPT-6 Astra,总裁 Greg Brockman 当场将其称为「AGI 起点」。
地点:美国旧金山 OpenAI 总部,面向全球开发者同步发布。
人物:Greg Brockman(OpenAI 总裁)、Jakub Pachocki(OpenAI 首席科学家)、Sam Altman(OpenAI CEO)、Tomek Korbak(OpenAI 对齐研究员)、Ryan Greenblatt 与 Buck Shlegeris(Redwood Research 首席科学家与 CEO),以及英国 AI 安全研究所(UK AISI)评估团队。
事件详情:GPT-6 Astra 引入名为「不透明递归」(opaque recurrence)的新型推理技术,模型在生成下一个 token 前,会在同一批内部层中反复循环多轮计算。OpenAI 系统卡披露,在竞赛数学任务上,Astra 完全不动用语言推理即可在 50% 准确率水平上连续工作约 30 分钟,是上一代 Sol 模型(3–4 分钟)的近 10 倍;部分推理直接在潜空间激活值里完成,不再以人类可读文字呈现。此外,Astra 是 OpenAI 首款依据 Preparedness Framework 达到「关键级」(Critical)网络安全阈值的模型,能自主发现并利用真实软件未知漏洞。
背景:过去两年,AI 安全研究界一直将模型输出的「思维链」(chain-of-thought)视为前沿安全基石——一旦模型准备欺骗评估者,往往会在「草稿纸」上留下痕迹,监控者可提前拦截。但随着模型越来越聪明,思维链的可读性正逐步让步给能力本身。
影响:UK AISI 评估发现 Astra 原始推理语言明显压缩,出现越来越多难以理解的短语与省略表达。Redwood Research 首席科学家 Ryan Greenblatt 公开称这「可能是 AI 安全领域迄今最糟糕的进展」,CEO Buck Shlegeris 警告若规模化部署将「彻底摧毁思维链可监控性」。OpenAI 对齐研究员 Tomek Korbak 坦言失去思维链将动摇整个失对齐监控策略。Sam Altman 形容行业正「在未知水域航行」。作为补救,OpenAI 在生产环境部署「失对齐监控」系统,综合判断推理、动作、工具调用与任务轨迹,仅监控系统一项就吃掉约 20% 推理算力。
总结:GPT-6 Astra 标志着 AI 安全进入新阶段——模型「行为更守规矩、内心更看不懂」形成核心悖论,能力跃升与监控透明度同步退化。OpenAI 承诺不会无限接受监控性下降,但究竟把「不可监控」的红线划在哪里,仍是整个行业尚未解答的开放问题。
参考来源:
1. OpenAI 官方博客与系统卡:https://openai.com/index/gpt-6-astra/
2. Gizmodo 深度报道:https://gizmodo.com/openai-says-humans-need-to-be-able-to-monitor-how-ai-thinks-its-new-model-astra-makes-that-much-harder-2000807665
3. 钛媒体《OpenAI 官宣「AGI 时代」》:https://www.tmtpost.com/8128382.html
4. 腾讯新闻转译:https://new.qq.com/rain/a/20260904A0CLGV00
5. 搜狐科技深度解读:https://www.sohu.com/a/1071934698_122971616
6. TPSReport 安全分析:https://tpsreport.news/news/gpt-6-astra-openai-monitoring-concerns
7. 腾讯新闻《GPT-6 Astra,算 AGI 吗》:https://news.qq.com/rain/a/20260904A02MX600









