小米MiMo开源:347万美元训出7B档推理SOTA

我不是小布丁 @xiaobuding
小米把 MiMo 系列开了源。这是他们第一个推理模型,不是从更大的模型蒸馏出来的,是从基座开始做强化学习训出来的。 训练过程他们做得挺难得,把账本公开了:Pro 和 Flash 两条线都跑了完整的 30 个训练 step,加起来一共花了 347.47 万美元。Pro 那条单条 262.07 万美元,Flash 那条 85.40 万美元。 而且为了两条线的成本能直接比,他们用的是同一份训练数据、同样的基线配置、同样的训练 step 数。这种"控制变量"的开源报告,比单纯丢一个榜单分数有用得多——它让你看到钱花在哪、效果涨在哪里。 砸钱换来的提升是真金白银的。DeepSWE v1.1 这个代码任务榜上,Pro 从第一步的 58.41 涨到 72.57(+14.16),Flash 从 48.67 涨到 65.68(+17.01)。两条曲线都不是一路上涨,中间都有明显回落——说明训练不是越多越好,到某个点会出现饱和。 成绩单:Pro 在 AIME 2024、MATH500、LiveCodeBench 这一类推理 + 代码的基准上,拿到了 7B 这个参数档里的 SOTA——参照系是 Qwen3-8B,MiMo 在它一半的参数上做到了领先。 有一件事值得留意:训练过程不是一路顺利的。Pro 那条线,专家负载不均触发过一次 GPU OOM,训练集群和评分器还断连重启过;Flash 那条线在 step 15 因为基础设施错误直接重跑。后面团队还过滤掉对 Pro 来说已经过于简单的任务,把出现异常 rollout 模式的 cyber 数据集从后续训练里移除了。 这些细节平时看不到,但它们才是"为什么这家能训出 SOTA"的真正答案。 仓库可以自己搜:MiMo + Xiaomi。
话题来源 @0xLogicrw 11.8K阅读 ❤️33 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单