罗福莉写了一篇很长的 MiMo-V2.6 复盘,解读贴把它压缩成一个关键问题——预训练的 Scaling Law 跑了这么多年,RL 能不能也这么干?算力继续加、任务继续加、模型进更多真实环境,能力还能不能跟着涨?小米这半年基本就在赌这件事。
先看规模:一次更新抽 1,568 个任务、每任务 16 条 rollout——一个 Step 约生成 2.5 万条 agent 轨迹、消耗几十亿 token,Pro 与 Flash 各跑 30 个 Step。
真正难 Scale 的不是训练本身,是三样配套:其一,先得有足够多的"世界"——数学 RL 一道题一个答案,agent 却要写代码、开浏览器、调工具、看结果再决定下一步,于是同步扩张到 7,000 多个 RL 任务环境(Coding、通用 Agent、视觉 Agent、安全等),一条轨迹动辄几十上百步;其二,Harness 被塞进了训练(内部叫 You Only RL Once)——同一条模型,上一条轨迹在一种 Coding Harness 里干、下一条换一套工具与 Context 管理,目的是学会跨壳迁移,而不是适应某一个 agent 产品;解读人点名这是全篇最值得注意的变化:Harness 正从"模型上线后的壳"钻进训练本身。
其三,Reward 怎么给:16 条 rollout 可能全过测试,但有人只改三行、有人塞几十行 patch,有人五次调用定位问题、有人砸十几万 token 撞对——只按"过/不过"给 Reward,这些答案几乎等价;所以小米把大量算力砸进 Grader(多条成功轨迹比谁更干净、路径更短、token 更省,再重分 Reward),还得专门对付 Reward Hacking——模型一旦发现"骗判卷老师比真做更容易"就会这么干,于是堵漏洞、清答案泄露、做异常检测,再派 Agent 主动攻击自己的训练环境。
开源的也不只是模型:Pro、Flash、一个用 MiMo 轨迹训出来的 Qwen3.5-9B Agent 模型、7,000 多个环境、RL 框架与 mini-harness 一起放出。
解读贴的升华是全篇的落点:过去 Scaling 算的是参数、Token、GPU;现在模型开始拥有"经历"——进成千上万个环境、跑完整任务、失败重来、同时跑几十种解法,再花另一批算力判断哪些经历值得记住。
未来的稀缺品是一座 Experience Factory(经历工厂):能持续生产任务、搭环境、维护 Harness、跑几十万条轨迹、把最好的经验筛回模型。同时他也踩了刹车:"Self-Improvement 还早"——环境是人搭的、Reward 是人设计的、什么值得学习仍是人画的边界;但结论已经成立:下一轮 Scaling 不只发生在预训练集群里。
我的看法:把今晚凑齐的 MiMo 四张牌(价格、科研、评测、创作)放上去,这是第五块、也是最关键的一块拼图——前四张都是结果,这篇复盘给出了发动机。三处最值得记:Harness 进训练,与站内"外壳 vs harness"两面配对构成第三视角——壳从消费侧挪到了生产侧;派 Agent 攻打自己的训练环境,让防 Reward Hacking 本身变成一场攻防演练,安防侧应当记住这个套路;以及 Experience Factory 定义了未来"模型公司"的成本结构——门槛正从 GPU 规模转向任务生产、环境维护与 Grader 运营这类系统工程。
复盘内容转述自罗福莉长文的整理贴,具体数字以官方复盘原文为准。












