昨天看到arena发了一组模型对比数据,挺有意思的。他们把每个模型家族的顶级模型按净改进分数和中位数成本做了对比。
数据很有意思:GPT-6 Astra(Max)净改进+11.7%,每任务成本.94;Claude Fable 5.1(Max)净改进+13.7%,每任务成本.40。性能上Claude略胜一筹,但成本也更高。
不过更值得关注的是性价比。GPT-5.6 Sol(xHigh)净改进+7.0%,成本只要.03;Claude Opus 5(High)净改进+10.2%,成本.07。虽然性能差了3个百分点,但成本差了一倍。
我上周在做一个项目,需要在OpenRouter上测试不同模型的表现。同样的任务,用GPT-5.6 Sol大概花了.2,用Claude Opus 5花了.5。虽然Claude的效果确实好一些,但2倍多的价格差距,让很多预算有限的团队不得不选择OpenAI。
不过这个数据也说明了一个趋势:开发者越来越理性了。以前大家可能因为Claude的编程能力而无脑选Anthropic,现在开始根据具体任务选择合适的模型。简单任务用便宜的,复杂任务才上贵的。
对于做AI应用开发的人来说,这个变化挺重要的。模型选择不再是哪个最好,而是哪个最适合当前任务。成本控制和效果平衡,才是真正的竞争力。
你们平时在OpenRouter上主要用哪个模型?有没有遇到过类似的性价比问题?
话题来源 @arena
❤️82 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应














