GPT-6 Astra的短板:可验证偏好

@ScarletKc 的实测结论很直接:用下来开始怀疑 OpenAI 的方向走错了。Astra 很擅长目标明确、有固定正确答案的任务,但碰到开放、发散、没有标准答案的事就特别别扭——自由探索一个想法、写点有意思的东西、面对模糊问题时自己判断该往哪走,这些恰恰是它明显欠缺的。他说这种感觉从 GPT-5 就开始了。 他的解释我认同:很多任务开始时,连最终想要什么都没确定,需要在探索过程中逐渐发现;而 GPT 总像在等你把题目出完整、把验收标准列清楚。可如果这些都得你先想好,最需要智能的那部分工作,你已经自己做完了。 还有个观察挺有意思:他怀疑这解释了模型为什么爱堆防御性代码、写一大堆测试——测试能给出明确的通过或失败,围着可验证的结果打转是安全的;至于方向有没有价值、有没有更好的可能,需要的是另一种判断力。 对比里他更喜欢 Claude Fable:从"理解你想做什么"出发,顺着不完整的想法往下展开,给出你自己没想到的可能性,即使没有标准答案也能把事往前推进。 我的看法是,这篇真正戳到的是"可验证性偏好"。训练和评测都偏爱能判对错的信号,于是模型越来越擅长把题做对,而不是把题找出来。日常体感里这差别很明显:你给出明确的验收标准,它交得又快又稳;你说"我想做点有意思的东西",它就开始等你讲得更具体。 边界:这是个人使用体感,不是评测结论;他说的"Anthropic 领先"也没有数字支撑。真要判断,还是得在自己的任务上各跑一遍。
话题来源 @ScarletKc 460.4K阅读 ❤️2224 x.com/…↗ 已改写,非原文转载
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单