新论文厘清 RL 后训练边界:随机奖励无法提升能力,但可教出新技能
natashajaques · x · 2026-09-13
Natasha Jaques 等人发布论文《Demystifying Reinforcement Learning Post-Training of Language Models》(arXiv:2608.24949),通过受控玩具实验系统拆解 LLM 的 RL 后训练机制,作者定位为一篇实用教程。
核心结论:
- 在随机奖励(spurious rewards)上做 RL 后训练,通常不能提升模型能力,只在特定条件下例外;其效果取决于后训练所用的 prompt 分布。
- 但 RL 后训练可以教会基础模型 pass@k 分布中不存在的新能力——即 RL 不只是「筛选」已有行为。
- 论文逐一考察基础模型先验分布、奖励信号粒度、prompt 分布多样性与模型规模如何影响 RL 成效,并以策略输出分布的熵为透镜,比较预训练、SFT、RL 后训练各自如何塑造模型确定性。
- 解释了 RL 成功与否取决于基础模型是否已在目标行为上放置足够概率质量,与经典 RL 的 exploration/exploitation 概念相连。
「研究」频道最新
- 陶哲轩新论文:AI 时代数学的稀缺资源从找证明转向理解证明 — NandoDF · 2026-09-13
- Raji 呼吁为前沿 AI 审计生态重写「谁审计审计者」 — rajiinio · 2026-09-13
- 前沿 AI 监督缺方法不只缺机构,学者征集协作方向 — timrudner · 2026-09-13
- NVIDIA 官方拆解 Nemotron 后训练全流程,工具链全部开源 — NVIDIA Developer · 2026-09-13
- 学者设 750 欧代码悬赏,GPT 上线后每天收到多条 bug 报告 — Singularitarian · 2026-09-13
- 递归循环 Transformer RLT 开源:潜空间推理实现无限深度 — inductionheads · 2026-09-13