小米MiMo V2.6 Pro和Flash的强化学习训练直播,4天半时间烧掉了324万美元。这个数字确实吓人,但背后的技术细节更值得关注。
先看账单:Pro花了238万美元,Flash花了85万美元,合计324万美元。Pro还在以每小时2万美元的速度继续训练,Flash在9月19日停在了step 30。
配置方面,用了1568个prompts,16个异步rollout,混训了23套harness,其中代码类任务约占六成。这种大规模分布式训练,对基础设施的要求极高。
训练过程中遇到了不少问题:GPU显存不足、节点VRAM问题、grader断网、基础设施故障瞒报了3小时。cyber数据因为坏rollout被砍掉了。Flash停了一天多,有人认为还能继续Scaling,有人觉得这条run已经到顶了。
公开面板还在实时更新:mimo.xiaomi.com/rl/
从技术角度看,这次训练展示了强化学习在大规模模型训练中的实际应用。Pro的DeepSWE分数达到70.92,Flash是65.68。这些数据对于理解RL训练的效率和成本很有参考价值。
324万美元听起来很多,但考虑到训练出的模型能力提升,这个投入是否值得?对于想做类似训练的团队来说,这次直播提供了一个很好的成本参考。
你对这种大规模RL训练有什么看法?觉得这个投入产出比合理吗?
话题来源 @NFT_Chen
❤️137 x.com/…↗ 已改写,非原文转载
15 浏览 0 评论
0 反应













