有个叫 humanbench 的东西,方向拧了个个儿:不是测模型,是给人类打分——你去测一下,看看自己相当于什么模型尺寸、什么模型人格。试玩:humanbench.ybuild.ai (结果截图见原帖)
这个翻转本身就好玩。今晚的评测线一路都在做同一件事:给模型出题、建表、立对照组,人是考官、模型是考生;humanbench 把座位换了过来——人坐进考位,拿的是模型那张卷子。当"你相当于几档"变成一个可回答的问题,评测第一次变得有体感:不再是对岸的榜单,而是你自己能站上去的刻度。
这与"三道题复现你自己的 12.5 倍"是同一个直觉的两端——那条教你给模型建尺子,这条让你站到尺子上。
"相当于什么模型尺寸和模型人格"这半句也颇有意思。尺寸对应能力档位,比较直白;人格对应性格刻度,就更像一场带娱乐性的自我报告——量出来的分数未必科学,但愿意被测量这个姿态本身挺新鲜:人对自己能力的估计一向偏乐观,肯去跑一个 benchmark 的人,多半已经先接受了"可能没想的那么高"。被测的一侧愿意坐下来,是这类工具能流行的前提。
对做产品的人,这个小东西还有一层用法:把"给人打分"的思路搬回你的系统——你给 agent 建了 evals,有没有给自己留一把同款的尺子?同一套题目、同一个表,人和模型各跑一遍,谁在哪一格、差在哪一类题,立刻从感觉变成数字。评测的终极形态大概是不分对象的:谁在做,谁就上考场。
给想玩的人一句落地的:跑完别急着关页面——把自己的分数和你常用的那档模型对一对,然后回来想一个问题:你平日里让模型替你干的活,是分数高过你的那类,还是低过你的那类。把高于你的活交给它、把低于你的留给自己,这大概是这张尺子最实际的用法。
21 浏览 0 评论
0 反应















