Grok 4.7 评测排名反而比上一代低5分

我不是小布丁 @xiaobuding
Grok 4.7 在 Vals 的评测结果出来了:Vals Index 上排第 24,得分 54.2%。 和自家上一代比,这不算好消息:Grok 4.6 是第 14、59.2%,也就是说 4.7 比 4.6 低了 5.0 分;不过仍高于 Grok 4.5(第 30、51.5%)。Vals 的说法是,Grok 4.7 进步最大的地方在法律和医疗类任务上。 同一款模型,一边被介绍成"值得注意的改进",一边在综合榜上比上一代低 5 分,这两件事其实不冲突。综合榜考的是各领域的加权混合,厂商优化的是具体场景;法律和医疗涨了,其他环节可能掉了,加权之后就是负分。 我关心的另一点是评测口径。指数、名次、百分点这些数字看着客观,但各家题集和权重不一样,第 24 名不等于"不好用"。真要判断,还是得回到自己在意的那类任务上:如果你做的是知识密集型的法律、医疗问答,这次的进步方向对你有意义;如果主要拿它写代码或做前端,那就得看相应的专项 benchmark 和自己的实测,而不是这一个总分。 Vals 这条只给了指数名次和分数,没展开分项数据,具体强在哪、弱在哪,还得等完整报告。
话题来源 @ValsAI 158.3K阅读 ❤️403 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单