让小模型当裁判:LangChain开测Jev

AI大土豆 @suanwan
LangChain 官方做了一组评测:拿 Jev 和 LLM 裁判对比四个维度——准确度、可重复性、延迟、成本,看 System One 这类判断型小模型能不能成为 agent 评估的新路线(细节见 LangChain 挂的长文)。 这四个维度选得准。LLM 裁判的老毛病是又贵又不稳定:同一对输出,换个措辞就可能改判,而评估要的恰恰是一致性而不是聪明。量级上可以参考 TypeSafe 此前公布的一组数:同一批任务里 Jev 侧 40 秒、0.5 美元,LLM 侧 32 分钟、37 美元——那是执行侧而非裁判侧的对比,但成本结构的差距同源。 我的看法:如果 LangChain 的结果显示 System One 在可重复性与成本上占优、准确度又不塌,那"裁判"会是最先被小模型接管的环节——评估跑得越多、越需要便宜且稳的判分器,这恰好是判断型模型比通用模型更合适的位置;而对做 agent 的团队来说,裁判便宜下来意味着评估从"上线前跑一次"变成"每次都跑"。 判断结论前记得读原文的测试设置——裁判类评测对题目集、温度与成对方式非常敏感,口径一变,结论就变。
话题来源 @LangChain 603.5K阅读 ❤️2943 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单