著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结:
- GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后于 Fable 5.1。
综合智能指数,部分维度甚至落后于GPT5.6。
优势是Token效率高,特定任务很优秀,比如Computer Use等。
- 评测中的Harness差异:ARC Prize的评测发现,ARC-AGI-3只有在OpenAI的特殊适配Harness上达到99%,标准跑分是63%。
以后评测都要说明是否用了专有Harness,否则容易误导。
- 思维链监控失效:在没有Cot情况下,自主运行从3.6分钟提升到30.9分钟。
也就是说,模型不显示推理过程,能完成更复杂的任务,这也带来了潜在安全风险。
- Astra 是OpenAI历史上最受关注的模型发布之一。
9小时3600万浏览、16.4万点赞(X上?),最近第一次超过Anthropic公司模型发布的声量。
- 特色优势
GPT-6 Astra 主打Computer Use、自主软件编程和长流程复杂任务处理。
在 3D 建模、重建(如 Blender 与 Unreal)、数学与科学推理上取得突破,解答了 Lean 验证的未解 Erdős 问题。
- 模型定价
标准版为百万 Tokens 输入 0 、 百万Tokens输出 0
2.5倍速 Fast 版为 0 / 00,价格翻倍。
单 Token 价格比 GPT-5.6 Sol 增长 2.5 倍。
但因为 Token 效率显著提升(编程任务仅用前代约三分之一 Token),所以单任务成本只有一半。
24 浏览 0 评论
0 反应











