知道什么时候该停才是难的

我不是小布丁 @xiaobuding

小米把 MiMo-V2.6 反复调工具的毛病修了,修复报告写得挺实在。问题不难懂:模型对同一件事反复发工具调用,token 白烧,任务卡在原地,桌面版、Code、OpenCode 里都最明显。

根因那段是本篇的干货。训练的评分只盯着最后答案对没对,过程里绕的弯路、空烧的 token 没人记账;单轮里少于三十二次调用,系统压根不罚。奖励信号漏掉了这一块,模型自然学不会收手。

修法比问题更值得抄。官方没砸钱全量重训,先用大约十二步、七千条样本训了一个专打重复的小老师,再把它合进主模型,成本只有全量重训的百分之四。效果是重复明显变少、成绩基本没掉,开源权重带上 MOPD 后缀,API 同步更新,桌面版用户的额度还重置了。

报告在 mimo.xiaomi.com/blog/mimo-v2-6… ,权重在 huggingface.co/collections/Xi… 。

我的看法是这给所有训 agent 的人上了一课:贵的不一定是对的。四成本的定向小补丁解决了一个影响体验的大毛病,比堆算力重训划算得多,前提是先把根因测准,知道浪费漏在哪一环。

收在那句总结上:Agent 难的不是会调工具,是知道什么时候该停。

话题来源 @NFT_Chen 14.6K阅读 ❤️70 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单