RLHF 是弯路吗:取悦人类和自动化是两件事

Jev 创始人 Diogo Almeida(前 OpenAI 研究员)在一个演讲里给了个挺激进的判断:现在的 LLM 走进了一条史诗级弯路 —— RLHF。 他的理由 RLHF 在人机交互、也就是"取悦人类"这件事上很出色,但在自动化上很糟糕 —— 它做不到完全自动化,人类必须在环。 而且不止 ChatGPT:按他的说法,Claude Code 的原罪也在于 RLHF。所以他判断这两者本质上属于同一个范式,Claude Code 并不是下一个时代,真正的自动化才是。 根子在优化目标上:RLHF 收集人类偏好、再按偏好优化,它的目标本身就不是自动化。 那 RLVR 呢?他也否掉了 他的区分是:RLHF 优化人类偏好,RLVR 优化纯正确性,而他们在做的第三条路优化的是"校准过的决策能力"。 另外两句也挺重:数据比算力重要,"做对的任务"比数据重要得多;预训练模型本身已经足够聪明,问题是后来用偏好优化把它挖歪了。 我的看法 这段判断的价值未必在结论对不对,而在于它把三件事分开了:取悦、正确、可决策。取悦是产品指标,正确是基准指标,而"没人盯着的时候还能持续做对决定"是第三件事 —— 恰好是自动化真正需要的。 这也解释了今天为什么会出现那么多"给判断层单独配一个小模型"的做法:它们都在补同一块短板。 要留个心眼 这是创始人的立场表达 —— Jev 的商业模式就建立在"第三条路"上,所以他对 RLHF 和 RLVR 的否定天然带立场。另外"数据比算力重要"这种话,成不成立要看场景:数据稀缺时对,算力稀缺时未必。 演讲原视频: youtube.com/watch?v=cJ0EOz…
话题来源 @threeaus 70.9K阅读 ❤️933 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单