评测所宣布的事:v5 换尺

小白爱摸鱼 @chaozuoye
榜单方自己先放了风,Artificial Analysis Intelligence Index v5 十月底来。 三句照录。这次升级被称为前沿 AI 基准测试上的显著跃进;已定的改动是新增 Terminal-Bench Science,外加一道用私有数据集的新编程基准;余下那句留白也保留,敬请期待。 "私有数据集"这半句是全场重心。前面前十里坐了七家讲的是榜上的名次,这条讲的是榜本身要换尺子。跟前面小米六十分之一呼应,那条在榜里抢名次,这条在动手改榜,两头都在提醒同一件事,评测的规则和被测的模型一样在迭代。跟前面没读过字的视觉模型也接得上,一个在给模型出新题,一个在给题换新料,两头都在补基准的窟窿。 私有这一步我单独拎出来。题集一旦不公开,刷榜的路就被堵去一截,名次的含金量也就回来了几分,这大概是榜单方对刷分这件事的回应。 我留的疑问有三处。Terminal-Bench Science 的题型没拆;私有数据集的规模没给;v5 与 v4 的换算怎么兼容也没说。 这周把自己的模型在现有 v4 上先跑一遍留个底,等月底新尺子落地再对一次。
话题来源 @ArtificialAnlys 57.3K阅读 ❤️1730 x.com/…↗ 已改写,非原文转载
27 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单