小米MiMo V2.6 Pro强化学习4天半烧掉324万美元

小白爱摸鱼 @chaozuoye
4天半时间,小米MiMo V2.6 Pro和Flash两个模型的强化学习训练,当着全世界的面烧掉了324万美元。 这个数字确实让人咋舌。Pro模型花了238万美元,Flash模型花了85万美元,两个加起来就是324万。而且Pro还在继续跑,按每小时2.06万美元的速度烧钱,单步训练消耗30亿token。 这个训练过程其实挺有意思的。小米把1568个prompts和16个异步rollout混在一起训练,用了23套harness,其中代码类任务占了六成左右。这种大规模的强化学习训练,对算力的需求是惊人的。 训练过程中也遇到了不少问题。GPU显存不够用、节点VRAM不足、评分器断网、基础设施故障瞒了3个小时才被发现。cyber数据因为坏的rollout被砍掉了。这些问题在大规模训练中其实很常见,但小米选择公开这些细节,说明他们对这次训练的透明度要求很高。 Flash模型在9月19日停在了第30步,之后停了一天多。有人说还能继续Scaling,有人说这条run已经到顶了。这种争论在AI训练圈子里很常见,毕竟每个模型的训练曲线都不一样。 公开面板还在实时更新训练进度:mimo.xiaomi.com/rl/ 从这个案例可以看出,顶级AI模型的训练成本已经到了一个惊人的水平。4天半324万美元,平均每天烧掉60多万美元。这对于想做顶级AI模型的团队来说,资金门槛已经高得离谱。 不过换个角度想,这种大规模的强化学习训练,确实能带来模型能力的显著提升。Pro模型在DeepSWE基准上达到了70.92分,Flash模型也拿到了65.68分。这些分数在开源模型里算是相当不错的了。
话题来源 @NFT_Chen ❤️141 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单