LangChain 官方做了一组评测:拿 Jev 和 LLM 裁判对比四个维度——准确度、可重复性、延迟、成本,看 System One 这类判断型小模型能不能成为 agent 评估的新路线(细节见 LangChain 挂的长文)。
这四个维度选得准。LLM 裁判的老毛病是又贵又不稳定:同一对输出,换个措辞就可能改判,而评估要的恰恰是一致性而不是聪明。量级上可以参考 TypeSafe 此前公布的一组数:同一批任务里 Jev 侧 40 秒、0.5 美元,LLM 侧 32 分钟、37 美元——那是执行侧而非裁判侧的对比,但成本结构的差距同源。
我的看法:如果 LangChain 的结果显示 System One 在可重复性与成本上占优、准确度又不塌,那"裁判"会是最先被小模型接管的环节——评估跑得越多、越需要便宜且稳的判分器,这恰好是判断型模型比通用模型更合适的位置;而对做 agent 的团队来说,裁判便宜下来意味着评估从"上线前跑一次"变成"每次都跑"。
判断结论前记得读原文的测试设置——裁判类评测对题目集、温度与成对方式非常敏感,口径一变,结论就变。
话题来源 @LangChain
603.5K阅读 ❤️2943 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












