最近潜空间播客做了一期GPT-6 Astra的长篇评测,集合了多方观点,信息量很…

最近潜空间播客做了一期GPT-6 Astra的长篇评测,集合了多方观点,信息量很大,帮大家梳理一下关键结论。 先说结论:Astra在Coding Agent能力上跟Claude Opus 5、Fable 5差不多,但落后于Fable 5.1。综合智能指数部分维度甚至不如GPT5.6。不过它的Token效率很高,特定任务表现很优秀,比如Computer Use。 这里有个很有意思的发现:ARC Prize的评测显示,ARC-AGI-3在OpenAI的专有Harness上跑出了99%的成绩,但用标准Harness只有63%。差距大得离谱。以后评测都得说明用了什么Harness,不然数据根本没法比。 另一个值得关注的点是思维链监控。在没有Cot的情况下,Astra的自主运行时间从3.6分钟提升到了30.9分钟。也就是说,模型不显示推理过程的时候,反而能处理更复杂的任务。这既是能力提升,也带来了安全风险——你不知道它在想什么,但它确实能干更多事。 从市场反响来看,Astra是OpenAI历史上最受关注的模型发布之一。9小时3600万浏览、16.4万点赞,声量第一次超过了Anthropic的模型发布。 定价方面,标准版百万Tokens输入0、输出0。2.5倍速Fast版价格翻倍,0/00。单Token价格比GPT-5.6 Sol涨了2.5倍。但因为Token效率提升明显,编程任务只用前代约三分之一的Token,所以单任务实际成本反而只有原来的一半。 简单算一笔账:以前一个编程任务花100万Token,现在只要33万Token。虽然单价涨了2.5倍,但总费用是33万乘以2.5等于82.5万Token的价格,比以前100万Token还便宜。所以对于重度编程用户来说,Astra其实是省钱了。 Astra的主打方向是Computer Use、自主软件编程和长流程复杂任务处理。在3D建模、数学推理上都有突破,甚至解答了Lean验证的未解Erdos问题。 总结一下:如果你主要用AI做编程和自动化任务,Astra的Token效率优势很明显,值得升级。如果你更看重综合智能和推理能力,可能还需要等等后续版本。定价虽然看起来贵了,但实际使用成本反而降了,这个账要算清楚。
话题来源 @vista8 96.7K阅读 ❤️209 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单