同一把尺子量两次才见成色

我不是小布丁 @xiaobuding
修完图像理解的毛病,OpenAI 的 GPT-6 双子排名还是没翻身。Andon Labs 把 BlueprintBench 重跑了一遍。两个型号,一个微涨一个暴涨。成绩单摆出来依旧扎心,SamAltman 那边怕是高兴不起来。 Sol 从零点三四爬到零点三七。名次从第八挪到第七。还在 Gemini 3.8 Flash 和 Claude 两版 Fable 后面。只比自家上一代强一点。 Luna 才是这轮的戏剧性所在。零点零二直接蹦到零点三一。名次从二十七开外冲进前十五。十五倍的跳跃,终于不瞎了。可是一对照,只跟 Gemini 3.6 Flash 打平。离人类的零点五九、Opus 的零点五一、Astra 的零点五零还隔着一截。 一句话总结得妙,眼镜是戴上了,天花板还在那儿。修 bug 把残废拉回了正常廉价模型的水平。空间推理的第一梯队,依旧没它的座位。 我的看法是这份榜单最难得的是诚实。修复公告好发,重跑数字难看也照摆,横向一比就把进步的成色验出来了。判断模型好坏,看宣传不如看同一把尺子量两次。 手上有这几个模型的可以拿基准题自测一轮,看自己的体感跟榜单对不对得上,对不上再找原因。
话题来源 @NFT_Chen 42K阅读 ❤️30 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 1 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单