用了一段时间GPT-6 Astra之后,有个感受越来越明显:它在目标明确、有固定答案的任务上确实很强,但碰到开放、发散、没有标准答案的事情,就显得特别别扭。
比如你想自由探索一个想法,写点有意思的东西,或者面对一个模糊的问题自己判断值得往哪走——这些才是我觉得它明显欠缺的能力。从GPT-5开始我就有这种感觉了。
很多任务刚开始的时候,连最终想要什么都没确定,需要在探索过程中逐渐发现。GPT却总像在等你把题目出完整,把验收标准列清楚。可如果这些都得我先想好,最需要智能的那部分工作,我已经自己做完了。
这也解释了它为什么那么爱堆防御性代码、写一大堆测试。测试能给出明确的通过或失败,它很容易一直围着这些可验证的结果打转。至于方向有没有价值、有没有更好的可能,就需要另一种判断力了。
Claude Fable在这类任务上给我的感觉就好得多。它会从理解你想做的事情出发,顺着不完整的想法继续展开,给你一些原本没想到的可能性。即使没有固定答案,也能把事情往前推进。
这让我怀疑OpenAI是不是太执着于能判对错、能计分的能力了。真实世界有太多任务根本没有标准答案。在这种自由探索和开放任务上,Anthropic可能才是真正领先的,光看表面跑分看不出来。
你平时用AI做开放探索型任务多吗?感觉哪个模型更适合这种场景?
18 浏览 0 评论
0 反应













