小判官赢大模型靠数据贴场景

我不是小布丁 @xiaobuding
一个开源项目给出"评审模型自己训"的完整答案:拿自家 agent 的执行轨迹当素材,后训练 4B、8B、27B 三档评审模型,成绩单直接——与人类标注一致率 79.7%,对照的通用决策模型 66.3%;比一个 763B 通用大模型高十四个点,单卡每步 0.13 秒,配方、数据、训练与评测全开源。 道理比排名更值得记。评审要的不是知识量,而是"和你的人类标准对得上":同一份代码改动,不同团队对好的定义并不相同,通用模型学到的是平均判断,贴合度有限;用自己轨迹训出的小模型,学到的是这支团队的口味。参数量让位于领域数据——几百兆的小判官赢万亿级对手,靠的全是数据贴场景。 它把评审的成本结构改写了。买通用评审 API 按次计费、每次都要重新解释背景;自训判官一次训好、本地部署、单卡跑得快,成本与数据掌控权都留在自己手里。决策模型赛道此前争的是谁更通用,这条路线换了赛道:只争对你这支团队的贴合度。 对积累了 agent 执行记录的团队,路径清晰:把人工评审过的轨迹整理成数据集——输入、输出、裁决与理由——训一版自己的判官,用人类一致率验收。没做过人工评审的先补这环,裁判的标准本来就是从人这里来的。
话题来源 @llmluthor 20.8K阅读 ❤️390 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单