用小模型跑 RL 再迁移给大模型,清华和字节这个新方法把训练成本打下来了

当别人还在花大价钱用大模型跑 RL 强化学习的时候,有人已经找到了更省钱的路子——用小模型练好 RL,再把”心得”迁移到大模型上,效果居然还更好。

这是今天挂在 arXiv 上的一篇新论文的核心发现。清华大学和字节跳动的研究者提出了一套叫 Direct On-Policy Distillation(Direct-OPD)的方法,论文标题是《Weak-to-Strong Generalization via Direct On-Policy Distillation》。光看标题可能有点绕,但我给你把结论先摆出来:

用 Qwen3-1.7B 小模型跑 RL 训练,然后把学到的”经验”迁移给大模型,AIME 2024 数学基准从 48.3% 提升到 58.3%——用了 8 张 A100 GPU,总共只花了 4 小时。

这意味着什么?

以前团队想提升模型推理能力,标准做法是找最强的模型(比如 GPT-5 或者 Claude Fable 级别)跑大量 rollouts 做 RL 训练。强模型生成样本贵、跑得慢,光训练成本就可能烧掉几万甚至几十万美元。

Direct-OPD 给的思路是:在小模型上做 RL,因为便宜快;再把 RL 训练”学会”的那个策略变化,迁移给大模型。

具体怎么迁移?核心在于它不像传统蒸馏那样直接让学生模仿老师的最终输出——那样会把小模型本身的局限也一并学过来。Direct-OPD 比的是 RL 前后小模型自己的”行为变化”,把这个变化当成一种隐式奖励信号,再作用在大模型的 on-policy 状态上。

说人话就是:它学的是”RL 让小模型改变了哪些决策”,而不是”小模型最终决策是什么”。

这个方法有一个额外好处:可以串联多个 policy shift。 意思是你可以先让小模型学一道数学题的心得,再学一道代码题的心得,串起来迁移给大模型,每次都只是跑便宜的小模型 RL,最后汇总给大模型。

实验数据里还有一个值得注意的点:在 AIME 2024 上,Qwen3-1.7B 通过 Direct-OPD 从 48.3% 爬到 58.3%,对比直接用大模型跑 RL 的 step-matched 方法,Direct-OPD 在各项测试里都稳定更好。

这对于资源有限的团队来说是个明确信号:不是非得用最强模型才能练出好推理能力,关键是怎么设计迁移这条链路。

如果你们团队在跑模型微调或者 RL 训练,建议关注一下这个方向——特别是当你们的 target model 是中等规模的 MoE 或者 dense 模型时,用 Direct-OPD 的思路可能可以把训练成本打下来一个数量级。

论文地址是 arXiv:2607.05394,项目页面有代码和更多实验细节。

评论区

0 条评论

登录后可评论。

AI 论文日报 478 阅读