读完Nathan Lambert全部13讲RLHF课程:奖励模型压成单个数字是万恶之源

le_james94 · x · 2026-09-18

作者 James Le 完整学习了 Nathan Lambert(前 Allen Institute for AI 后训练负责人、《The RLHF Book》作者)随书发布的 13 讲课程并做了系统笔记。

核心论点:奖励模型对整个回答只输出一个标量分数(取 EOS 位置隐状态过 scalar head),用户抱怨的几乎所有 RLHF 问题——含糊其辞、莫名其妙的拒绝、模型过度迎合——都是这个压缩的下游后果。InstructGPT 之后的几乎每种方法都在绕开它:拒绝采样跳过 RL、DPO 把奖励模型折进策略、RLVR 用可验证的 checker 替代人类判断、judge 与宪法用另一个模型或文档替代标注员。

作者的总体判断:可验证奖励(verifiable rewards)没有解决偏好问题,只是把它搬了家——当奖励不可验证且没有 checker 兜底时,你如何决定优化什么、如何知道自己走过头了?

另附第 13 讲「性格训练」的例子:Llama 3.1 8B 拒绝回答类固醇购买问题,微调成各种窄性格后依然拒绝,但讽刺型人格会猜你想成为下一个施瓦辛格——同样决策,不同人格。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →