读知乎回答有感,浅谈一下后训练benchmark。 Any benchmark …

哇!是牛来 @niulai
读知乎回答有感,浅谈一下后训练benchmark。 Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding的benchmark越来越泛化 / 众包化。其实LLM eval一直是个草台班子,每家都可以有自己的setting,而任何setting只要不被强行统一就存在操作的空间,最早可以调temperature / top_p / length,后来可以调harness / setting。 AA给出了一个相对“规范”的setting,让大家都听它的而不是野蛮生长,但这并不make sense。只要评测非中心化就一定存在noise,任何结果都可以是cherry pick后的,而AA官方的95%置信度结果就成了judge模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的AA分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要sell就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被AA所局限,而OSWorld v2、ALE、TB4 / TB-Sci等frontier众包benchmark已经告诉我们:最frontier的能力一定是最通用的能力,而agent已经站在了单domain能力的肩膀上。 现在的职业任务分为三类,已经被AI训练好的,无法被AI训练的,还在被AI训练的。所有能归纳在Computer Use的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包benchmark越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是frontier的benchmark就越有noise。如果benchmark团队不为自己的错题率负责,只会诞生越来越多的错题benchmark:GPQA-Diamond,HLE,充斥大街的弱模型judge。 为了消灭LLM-judge所引发的不确定性,众包benchmark一定会越来越商业化,而evaluation一定会在短暂的时间内迎来大洗盘。
话题来源 @sheriyuo 38.9K阅读 ❤️364 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单