修完图像理解的毛病,OpenAI 的 GPT-6 双子排名还是没翻身。Andon Labs 把 BlueprintBench 重跑了一遍。两个型号,一个微涨一个暴涨。成绩单摆出来依旧扎心,SamAltman 那边怕是高兴不起来。
Sol 从零点三四爬到零点三七。名次从第八挪到第七。还在 Gemini 3.8 Flash 和 Claude 两版 Fable 后面。只比自家上一代强一点。
Luna 才是这轮的戏剧性所在。零点零二直接蹦到零点三一。名次从二十七开外冲进前十五。十五倍的跳跃,终于不瞎了。可是一对照,只跟 Gemini 3.6 Flash 打平。离人类的零点五九、Opus 的零点五一、Astra 的零点五零还隔着一截。
一句话总结得妙,眼镜是戴上了,天花板还在那儿。修 bug 把残废拉回了正常廉价模型的水平。空间推理的第一梯队,依旧没它的座位。
我的看法是这份榜单最难得的是诚实。修复公告好发,重跑数字难看也照摆,横向一比就把进步的成色验出来了。判断模型好坏,看宣传不如看同一把尺子量两次。
手上有这几个模型的可以拿基准题自测一轮,看自己的体感跟榜单对不对得上,对不上再找原因。
话题来源 @NFT_Chen
42K阅读 ❤️30 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论
1 反应












