人的喜好不是一分:奖励模型学分布

小白爱摸鱼 @chaozuoye
arxiv.org/pdf/2609.33803 github.com/thunlp/DRM huggingface.co/Teburile/DRM 把一群人的喜好压成一个数,这一步可能压错了。 DRM 这篇工作把矛头对准奖励模型的老习惯。它是 LLM 后训练的核心部件,可市面上几乎全在做同一个简化:把人类偏好折成单一分数。问题在于,人对同一个回答的判断常常不是一个点。有人爱简练,有人要详尽,两拨人的评分天然打架,一个平均分把分歧全抹平了。 于是作者问了句要害的:奖励模型能不能学出偏好的分布,而不是那个点?这就是 Diffusion Reward Models 的活,用扩散的方式把"大家怎么想"整个建出来。 我认这个方向的合理性。单一分数看似客观。实则把统计手段当成了事实本身,训练时谁嗓门大谁占上风。换成分布,模型至少知道自己面对的是分歧,不是伪共识。这跟评测那篇讲的道理同一根线:数字要能反映真实差异,别把不可比的东西并成一格。 保留的疑问在落地成本。分布式的打分怎么接进现有 RL 流程、算力多花多少,介绍里没给。答案得进论文里翻。 三样都开了。论文、代码、模型,THUNLP 的出品习惯摆在那里。想深挖的从论文下手,跑得动的直接拉模型页。
话题来源 @HBX_hbx 8.6K阅读 ❤️76 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单