评测不是质检,是变更的准入证

Box 的 levie 把 AI 在企业落地的闸门点得很准:"你无法自动化你无法测量的东西。所以,evals 是 AI 在企业里扩散的闸门之一。"(转述自原帖)

他的论证分两步。第一步是对照:确定性流程(软件能测的那类)早就有测试托底;但企业对非确定性流程——也就是 agent 正在替他们干的那些活——至今没有任何像样的理解方式。第二步是清单:没有好的 evals,你根本不知道什么在工作、什么坏了、什么变了、什么改进了、什么可以再多做一点——而所有变更、升级、部署,都必须排在"好 evals"的下游。换句话说:评测不是质量部门的爱好,是每次改动的通行证。

这段话与今晚的评测线是同一枚硬币的两面。我们从"判卷可靠、学习才发生"讲到"三道题复现你自己的 12.5 倍",一直在个人与任务的粒度上转;levie 把它抬到了组织粒度:个人的 evals 是调优的尺子,企业的 evals 是信任的凭证——前者决定模型好不好用,后者决定敢不敢让 agent 碰业务。

没有它,"什么在工作、什么坏了、什么变了、什么该多做"这四个问题一个都答不上,而所有变更、升级、部署都排在好 evals 的下游——评测不是质检环节,是变更的准入证。

"确定性流程可用软件测试,非确定性流程却无从理解"这个对照,点出了企业落地真正的断层。传统软件的质量保障(单测、集成测试)之所以有效,是因为行为可预期——同样的输入理应同样的输出;agent 恰恰打破了这个假设,老一套测试文化面对它集体失语。

这也解释了今晚反复出现的"判卷"母题为何在企业侧更急迫:个人用户答错一道题损失有限,企业让 agent 多执行一步可能就是一笔真实的账。非确定性不是不能管,是要先把"怎么算对"写下来——而这正是所有 evals 的第一行。

"每家企业都需要对自己环境的评估"这半句,把机会也说透了。通用 benchmark 测的是模型的通识,但 agent 在你家表现如何,只取决于你家的数据、流程与边界——所以未来的评测市场必然是两层:实验室出通用尺、企业出自用尺;这也呼应今晚"三道题复现你自己的 12.5 倍"给个人的那版方法论——别只看别人的榜单,先建立自己的对照组,无论是对一个人、一台机器还是一家公司。

给要落地的人一句落地的:把"evals 从哪开始"缩到最小——挑一个 agent 正在干的真实任务,写下五问的期望答案(什么该在工作、什么不该碰、改了什么会怎样、哪步最容易坏、多做会好在哪),跑二十次把它变成一张能打分的表。表立起来之前,别谈自动化;表立起来之后,每一次升级才第一次有了对错。

话题来源 @levie 121K阅读 ❤️427 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单