EasyPPO 给大模型强化学习后训练开了一剂最小处方:别急着换算法,先把评判者修好。三件不做的事——不引入新策略损失、不设计新算法、演员网络更新原样不动;改动全在批评者一侧。换来的结果是全实验零训练崩溃,成绩还更好。
训练崩溃是后训练里最头疼的故障:跑着跑着策略发散,几小时算力一夜清零,回头还难定位哪一步开始坏的。常见应对是往算法里加稳定项——约束、裁剪、正则层层堆叠。这条路线反过来问了个更朴素的问题:如果策略本身没动过,坏的是不是评估?批评者负责估计价值、告诉策略这步好不好,估计一旦失真,策略学到的便是错的方向——修对这环,演员侧根本不用折腾。
这个思路与近期反复出现的工程哲学一脉相承:模型按兵不动,价值都在壳上。参数与算法不动,只校准旁边打分的部件,收益就直接兑现——这类最小手术在推理优化、评审模型、后训练三处接连奏效,复杂系统的改进往往不需要换心脏。
对自训模型的团队,两条检查先立起来:把崩溃监控做成训练第一优先级告警,把批评者的估计误差和奖励曲线放在同一张图上看。多数崩溃在批评者先失准的那几十步就已埋下,越早发现,损失的算力越少。翻新算法库之前,先确认打分的那位没有先晕。
话题来源 @MangQiuyang
34.8K阅读 ❤️267 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应










