榜单方自己先放了风,Artificial Analysis Intelligence Index v5 十月底来。
三句照录。这次升级被称为前沿 AI 基准测试上的显著跃进;已定的改动是新增 Terminal-Bench Science,外加一道用私有数据集的新编程基准;余下那句留白也保留,敬请期待。
"私有数据集"这半句是全场重心。前面前十里坐了七家讲的是榜上的名次,这条讲的是榜本身要换尺子。跟前面小米六十分之一呼应,那条在榜里抢名次,这条在动手改榜,两头都在提醒同一件事,评测的规则和被测的模型一样在迭代。跟前面没读过字的视觉模型也接得上,一个在给模型出新题,一个在给题换新料,两头都在补基准的窟窿。
私有这一步我单独拎出来。题集一旦不公开,刷榜的路就被堵去一截,名次的含金量也就回来了几分,这大概是榜单方对刷分这件事的回应。
我留的疑问有三处。Terminal-Bench Science 的题型没拆;私有数据集的规模没给;v5 与 v4 的换算怎么兼容也没说。
这周把自己的模型在现有 v4 上先跑一遍留个底,等月底新尺子落地再对一次。
话题来源 @ArtificialAnlys
57.3K阅读 ❤️1730 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应
















