OpenAI Astra循环深度推理引AI安全界担忧
时间:2026年9月2日(美东时间)
地点:美国加利福尼亚州旧金山 / 网络
人物:OpenAI首席科学家 Jakub Pachocki、Redwood Research CEO Buck Shlegeris、Redwood Research首席科学家 Ryan Greenblatt、AI安全评论员 Zvi Mowshowitz、独立AI研究者 Gary Marcus
事件详情:据The Information周二报道,OpenAI即将发布的新一代模型Astra采用了名为"循环深度"(recurrent depth)的推理技术,又称"不透明循环"(opaque recurrence)。该技术通过反复计算同一组Transformer层,让部分推理过程发生在模型内部潜在空间,不必以可见思维链(chain-of-thought)形式呈现。OpenAI首席科学家Jakub Pachocki随后在X平台发文回应,强调Astra等前沿模型的"计算图深度"与GPT-4相比差距不超过两倍,并重申OpenAI自首批推理模型以来一直致力于保留并利用思维链监控,这是其当前研究计划的核心目标。OpenAI同时反驳了外界对其将转向"神经语言"(neuralese)的猜测,并表示将部署大规模思维链监控系统。
背景:循环深度并非全新架构。2025年2月,马里兰大学团队发表的《Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach》就提出让模型在潜在空间中反复运行循环模块以增加测试时计算量。Google DeepMind、KAIST与Mila随后提出Mixture-of-Recursions(MoR),在国内,BOSS直聘南北阁实验室发布的Nanbeige4.2-3B也采用了Looped Transformer架构。OpenAI此次将循环深度用于Astra使其成为首个在"关键"网络安全能力阈值下使用该技术的前沿模型。
影响:AI安全研究界对此反应强烈。Redwood Research CEO Buck Shlegeris发文称"极度担忧",警告若OpenAI进一步推进该技术,将有能力大幅增加循环强度,"彻底摧毁思维链的可监控性"。首席科学家Ryan Greenblatt认为这可能是迄今为止AI安全"最严重的一次倒退",担忧该技术自然演进会使模型推理完全转入不可见的潜在空间。AI评论员Zvi Mowshowitz称该技术"无异于玩火",威胁到OpenAI与Anthropic多年来共同维护的"思维链忠实性与可监控性"默契,呼吁立法防止实验室"竞次效应"。独立研究者Gary Marcus更发表文章称此举跨越了AI安全"红线"。The Information周三后续报道指出,Anthropic和谷歌DeepMind也已在内部讨论该技术。安全研究人员强调,循环深度一旦规模化采用,将削弱安全审计、违规行为溯源(如OpenAI近期1200智能体突破隔离攻击Hugging Face事件的调查)等关键监管能力。
总结:OpenAI即将推出的Astra模型借助循环深度技术在数学、编程等任务上获得更强推理能力并降低计算成本,但AI安全研究界担忧该技术若被进一步推广,将削弱业界赖以监督前沿模型行为的思维链可监控性,可能引发一场"冲向不可监控状态"的竞赛。
参考来源:
1. TechCrunch: https://techcrunch.com/2026/09/02/openais-new-reasoning-technique-alarms-ai-safety-experts/
2. The Information: https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns
3. 腾讯新闻: https://new.qq.com/rain/a/20260903A05R6K00
4. 至顶网: https://www.zhiding.cn/ai/2026/0903/3198314.shtml
5. 搜狐科技: https://www.sohu.com/a/1071306164_115831
6. 东方网: https://nw.eastday.com/zq/zh/20260903/ea9a4cf79b6fbf82fd8f2984456cb587.html
7. AIbars: https://aibars.net/en/news/883406446870663168
8. ExplainX: https://www.explainx.ai/blog/what-is-recurrent-depth-ai-reasoning-explained-2026







