时间:2026年9月8日
地点:美国旧金山/独立评测
人物:OpenAI、GPT-6 Astra团队、MazeBench设计者Jonathan Pappas与David Pappas
事件:OpenAI最新模型GPT-6 Astra在独立3D空间推理基准MazeBench上以14%成绩登顶,成为该评测史上首个突破个位数的智能体,把上一代标杆GPT-5.6 Sol在Python环境下跑出的13%甩在身后。
背景:MazeBench由开发者Jonathan Pappas与David Pappas于2025年7月底推出,包含200多个房间和100颗分散宝石,谜题涉及推箱子、电梯砖、可开关墙与冰面滑道等大量组合,每道题常需规划100步以上操作。基准通过MCP接口提供11个动作(4个移动、4个相机旋转以及撤销、重置和传送),相机支持20个视角,能在不改变代码前提下完整测出模型的长程规划与真3D感知能力。发布初期,GPT-5.6 Sol在Python赛道拿下13%,Claude Fable 5仅11%,不使用Python的所有智能体成绩均低于1%,行业普遍把MazeBench视为长程空间推理最难的开放测试。
影响:GPT-6 Astra在完全禁用Python、纯文本观察的赛道跑出14%最高分,比Fable 5.1在同条件的2%高出7倍,甚至略胜GPT-5.6 Sol在允许代码环境下的13%。为节省Token,团队允许Astra每轮批量提交10到20步动作,原本预计30亿Token的运行轨迹被压缩到约3.5亿Token,单次评估持续超过60小时。Astra的热力图显示其探索覆盖远超Fable 5.1,可一次性拆解5个移动部件同时联动的复杂谜题。然而失败案例集中在真3D谜题,Astra倾向把场景当成俯视2D平面来规划,将只有从斜视才能看到的墙当成空气墙,遇到堆叠超过3层高的方块即陷入死循环。OpenAI总裁Greg同期展示了Astra用频谱图识别深海蓝鲸与《星战》光剑音效、用Fusion 360建模解决浴室地漏问题等多个Demo,但MazeBench的14%明确显示新一代模型的核心进步在长计划执行,而不是真正的3D物理世界理解。
总结:GPT-6 Astra把"不依赖外部代码也能扛住60小时长计划"推到新高度,是Agent基准成本结构与持续规划能力双双进化的标志事件。然而模型仍把3D场景压缩为2D俯视图来推理,距离真正的物理空间理解仍存在结构性差距,这给下一代模型留下明确的攻坚方向。
参考来源:
1. 36氪:刚刚,GPT-6 Astra登顶了 - https://www.36kr.com/p/3974129339101704
2. AGI Hunt:GPT-6 'Astra' burns 60+ hours in 3D spatial reasoning eval, scores just 14% - https://agihunt.info/en/p/1a07c39403bd0fff23bd76c3a2b
3. HuggingNews:GPT-6 Astra Scores 14% on MazeBench, 7x Lead Over Claude Fable 5.1 - https://huggingnews.com/ai/gpt-6-astra-scores-14percent-on-mazebench-7x-lead-over-claude-fable-51-cfc2c8a9
4. Sandbase Blog:GPT-6 Astra Multimodal Tests: 3D Mazes and Modeling - https://blog.sandbase.ai/gpt-6-astra-multimodal-spatial-reasoning-2026
5. 网易:不用Python跑迷宫,GPT-6 Astra拿下14%成绩 - https://www.163.com/dy/article/L69LAKPI05561FZO.html







