OpenAI和Anthropic已经开始走两条完全不同的模型路线了,Artifi…

成吉思鸡 @xiaoben
OpenAI和Anthropic已经开始走两条完全不同的模型路线了,Artificial Analysis最新一轮测试把这个分叉展示得特别清楚。 在AA-Omniscience这种偏知识覆盖和事实准确率的测试中,Claude几乎霸榜,前七名全是Claude系模型,最高做到67%。但到了CritPt这种偏物理推理的测试,第一名变成GPT-5.6 Sol,Claude虽然依然很强,但优势明显没那么夸张。 这可能是目前最清楚的一次,展示Anthropic和OpenAI在优先级上的分歧。 Anthropic现在明显在继续强化Claude的知识可靠性、企业任务和稳定输出。他们走的是让模型变得更靠谱、更可预测的路线。对于需要处理大量企业数据、生成稳定输出的场景,Claude确实越来越强。 OpenAI则越来越像是在押注推理深度,尤其是面对陌生问题时,模型自己把答案推出来的能力。他们走的是让模型变得更聪明、更能独立思考的路线。对于需要解决复杂问题、进行深度推理的场景,GPT-5.6 Sol确实表现更好。 两张Benchmark当然不能直接代表两家公司全部战略,但如果未来模型真正要跑Agent,这个差异可能会越来越重要。因为Agent真正遇到的麻烦,往往不是数据库里有没有答案,而是没人告诉它答案的时候,它能不能自己想出来。 对于做AI应用开发的朋友来说,这个差异意味着什么?意味着你需要根据自己的应用场景来选择模型。如果你的应用需要处理大量知识、生成稳定输出,Claude可能是更好的选择。如果你的应用需要解决复杂问题、进行深度推理,GPT-5.6 Sol可能更合适。 而且这个差异可能会在未来变得更加明显。随着两家公司继续沿着各自的路线发展,模型之间的差距可能会进一步拉大。所以现在就开始关注这个差异,提前为自己的应用做好模型选择的准备,可能会在未来获得竞争优势。 当然,这也意味着AI模型市场正在变得更加多元化。不再是某一个模型通吃所有场景,而是不同的模型在不同的场景下各有优势。这种竞争格局对于开发者来说是好事,因为你可以根据自己的需求选择最合适的模型,而不是被迫使用某一个模型。 总的来说,OpenAI和Anthropic的路线分歧正在变得更加清晰。了解这个差异,对于做AI应用开发的朋友来说,可能会在未来带来实际的价值。
话题来源 @MaxForAI 49.9K阅读 ❤️144 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单