@omarsar0 列了一份"现在就能试"的 Jev 用法清单,四条:
一,拿它做 LLM-as-a-Judge 的评测;二,给 agent harness 做路由;三,用更强的分类能力去"更聪明地创建子 Agent",从而把 agent 编排的规模做大;四,在需要结构化输出的场景里增强动态 harness 生成。
他直接说前三个在成本和效率上的 ROI 高得离谱,自己现在就是把 Jev 当成 meta harness 的一个"更聪明的路由器";第四个还在测,但认为潜力很大。他的总结是:这东西更像是改进 agent 的一个原语。
这几条我的解读是,它们分成两类。二和三是"路由与编排"——决定谁来干、要不要拆成子 Agent;一和四是"判断与结构化"——判断谁做得好、把模糊输入变成能用的字段。共同点是都不生成内容,只做判断,这正是这类模型的定位。
"原语"这个说法值得记一下。把 Jev 当成一个能嵌进任意流程的"判断函数",比把它当成又一个能聊天的模型要有想象力:评测要它打分、路由要它选、编排要它决定拆不拆、结构化要它把需求变成字段。对天天在搭 agent 的人来说,这类判断层值得单独留一个位置,而不是硬塞进已有的模型里凑合。
边界也说清:这些都是他个人在试的用法,完整指南他说"有兴趣再写",所以现在没有可复现的评测数字。另外"用模型评测模型"本身有争议——裁判偏好、位置偏差都会影响结论,真拿来做 LLM-as-Judge,最好保留一部分人工抽检做校准。
话题来源 @omarsar0
33.4K阅读 ❤️679 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论
0 反应












