读完Nathan Lambert全部13讲RLHF课程:奖励模型压成单个数字是万恶之源
le_james94 · x · 2026-09-18
作者 James Le 完整学习了 Nathan Lambert(前 Allen Institute for AI 后训练负责人、《The RLHF Book》作者)随书发布的 13 讲课程并做了系统笔记。
核心论点:奖励模型对整个回答只输出一个标量分数(取 EOS 位置隐状态过 scalar head),用户抱怨的几乎所有 RLHF 问题——含糊其辞、莫名其妙的拒绝、模型过度迎合——都是这个压缩的下游后果。InstructGPT 之后的几乎每种方法都在绕开它:拒绝采样跳过 RL、DPO 把奖励模型折进策略、RLVR 用可验证的 checker 替代人类判断、judge 与宪法用另一个模型或文档替代标注员。
作者的总体判断:可验证奖励(verifiable rewards)没有解决偏好问题,只是把它搬了家——当奖励不可验证且没有 checker 兜底时,你如何决定优化什么、如何知道自己走过头了?
另附第 13 讲「性格训练」的例子:Llama 3.1 8B 拒绝回答类固醇购买问题,微调成各种窄性格后依然拒绝,但讽刺型人格会猜你想成为下一个施瓦辛格——同样决策,不同人格。
「研究」频道最新
- Navier-Stokes 不到一月又传 Hodge 猜想被破,千禧难题加速告破 — haider1 · 2026-09-18
- Meaning Spark 实验推理时脚手架,增强 AI 元认知与反思 — PeterBowdenLive · 2026-09-18
- 虚拟细胞模型研究者加入 Cellular Intelligence,瞄准细胞疗法 — arjunrajlab · 2026-09-18
- 八个月迭代 ATLAS:不动权重把小模型推向接近前沿水平的编码系统 — itigges22 · 2026-09-18
- AI 文本水印反成软肋:研究称其放大对抗提示风险 — luisdans · 2026-09-18
- Jack Clark 回应 RSI 测量研究:26% 数字将广为流传 — jackclarkSF · 2026-09-18