上周有个做AI的朋友跟我吐槽,说他们团队想做Agent强化学习,结果光是搭建训练环境就折腾了两个月,最后效果还不理想。
我让他看看小米MiMo团队最近的动作。他看了之后直接在群里发了个表情包:这帮人是开了挂吧?
小米MiMo负责人罗福莉深夜发了条消息,说他们半年沉默只干一件事:把MiMo 2.6 Pro和Flash的RL scale到极限。具体来说,V2.6正在大规模强化学习中,单步约20亿tokens,1568个prompts乘以16个rollouts,全异步运行。
我上周试着用它做了一段技术文档的翻译。以前用其他AI工具总是要反复调整提示词,这个工具的指令遵循能力确实强,而且响应速度只需要几秒,比手动构思快了一到两个数量级。
从技术角度看,这个工具采用模块化架构,每个创作环节都有独立的处理单元。这种方法在开源社区一直存在争议,支持者认为这是效率提升,反对者担心会影响创作质量。
几个关键数字值得关注:项目完全开源,GitHub上有详细的文档和示例。官方自称在多个基准测试中表现优异。
这个工具的定位不替代传统强化学习框架,主要是为了补上它们不擅长的那一环:当你需要在Agent训练中嵌入多任务Agentic RL,要求组内credit assignment、测试用例奖励、评分量表奖励的时候,用传统工具做这件事成本高、速度慢、还可能生成不可预期的内容。
支持兼容OpenAI和Anthropic的模型与全文件扫描,适合受够误报和评论漂移的团队。
做AI应用开发、需要在视频制作中嵌入AI辅助功能的可以关注一下。
训练过程正在公开直播,细节将逐步开源:mimo.xiaomi.com/rl/
话题来源 @NFT_Chen
28.5K阅读 ❤️81 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论
0 反应











