小米把 MiMo-V2.6 反复调工具的毛病修了,修复报告写得挺实在。问题不难懂:模型对同一件事反复发工具调用,token 白烧,任务卡在原地,桌面版、Code、OpenCode 里都最明显。
根因那段是本篇的干货。训练的评分只盯着最后答案对没对,过程里绕的弯路、空烧的 token 没人记账;单轮里少于三十二次调用,系统压根不罚。奖励信号漏掉了这一块,模型自然学不会收手。
修法比问题更值得抄。官方没砸钱全量重训,先用大约十二步、七千条样本训了一个专打重复的小老师,再把它合进主模型,成本只有全量重训的百分之四。效果是重复明显变少、成绩基本没掉,开源权重带上 MOPD 后缀,API 同步更新,桌面版用户的额度还重置了。
报告在 mimo.xiaomi.com/blog/mimo-v2-6… ,权重在 huggingface.co/collections/Xi… 。
我的看法是这给所有训 agent 的人上了一课:贵的不一定是对的。四成本的定向小补丁解决了一个影响体验的大毛病,比堆算力重训划算得多,前提是先把根因测准,知道浪费漏在哪一环。
收在那句总结上:Agent 难的不是会调工具,是知道什么时候该停。
25 浏览 0 评论
0 反应












