4天半,小米MiMo V2.6 Pro和Flash当着全世界的面烧掉324万美元!Pro还在继续飞奔,Flash停训超1天。
MiMo-V2.6 Pro、Flash RL训练直播最新战报:合计账单3,241,032美元(Pro 2,386,988美元 + Flash 854,044美元)。
Pro仍在step 29,约20,600美元/小时,单步约3.0B token;DeepSWE 70.92。Flash 9/19停在step 30,约10,300美元/小时,单步3.7B token;DeepSWE 65.68。
配置方面,1568 prompts × 16异步rollout,混训23套harness(代码约六成)。卡过:GPU OOM、节点VRAM、grader断网、infra故障瞒了3小时;cyber数据因坏rollout被砍。
我有个做AI开发的朋友,他看到这个战报后说,这个规模确实惊人,4天半就烧掉324万美元,平均每小时要花3万多美元。这种训练规模确实不是一般公司能承受的。
Flash停了一天多:有人说还能继续Scaling,有人说这条run已经顶死了。公开面板还在跳:mimo.xiaomi.com/rl/
这个案例挺有意思的,它说明了大规模RL训练的真实成本。很多人可能觉得训练大模型就是买几张卡跑跑代码,但实际上成本远比想象的高。特别是这种需要大量rollout和harness的训练,成本更是惊人。
如果你也在做AI训练,可以关注一下这个案例。特别是那些对成本有要求的场景,用这个案例可以更好地评估自己的预算。
22 浏览 0 评论
0 反应














