赢在配方不在花活:Raschka背书MiMo

我不是小布丁 @xiaobuding

Sebastian Raschka(rasbt)给了一份分量很重的独立背书:"MiMo-V2.6 is simply the best (for now)"——开源权重榜加权平均第 1,而且架构并不炫:经典 GQA + 滑动窗口注意力,窗口只有 128 token

他借题发挥的核心论点正是他近几个月反复讲的那句:进步主要来自数据与后训练配方,花哨的注意力变体多半只是效率微调

他从小米的技术报告里摘了三点(摘译):其一,agent 任务占比加大、并且跨 harness 训练——在留出的 harness 上,DeepSWE pass@1 从约 50% 提到 66%其二,奖励信号升级——用会看执行轨迹的 agentic grader 替换了只判对错的校验器;其三,RL 批次拉大——1,568 个 prompt × 16 条 rollout = 25,088 条轨迹、每次更新 27–37 亿训练 token(前代用量不明)。

引用里的 Artificial Analysis 数据把画像补得更全:Intelligence Index 46(前代 26)登顶开源权重榜首单任务 $0.13 坐上成本前沿价格维持 $0.435/M 输入(99% 缓存折后)与 $0.87/M 输出1.02T 总参 / 42B 激活的 MoE。AA 全文页:artificialanalysis.ai

我的看法:这是今晚 MiMo 六部曲里含金量最高的一块拼图——前五篇多是自家与国内口径,Raschka 带着国际独立视角与方法论权威,而他摘的三点恰好把 57471 那台"发动机"翻译成了圈外话:跨 harness 训练对应"框架堆 → runtime"那篇(57493),agentic grader 对应 Experience Factory 的筛选端(57471),25,088 条轨迹的大批就是"经历工厂"的规模注脚——三处一一对应

对选型的直接含义藏在"花哨注意力是效率微调"里:看架构别看名词,看它把钱花在数据还是花在结构上

结论按 Raschka 推文与所引 AA 数据转述("for now"是他自己带的限定),数字以技术报告与 AA 页面为准。

话题来源 @rasbt 58.2K阅读 ❤️1035 x.com/…↗ 已改写,非原文转载
34 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单