研究称密集奖励能突破后训练天花板,稀疏奖励失效

joecole · x · 2026-08-28

帖子探讨了大语言模型后训练中的强化学习(RL)机制。核心观点指出,使用 0 或 1 的稀疏奖励(sparse reward)效果较差,难以找到模型从未采样过的行为;而 0 到 1 之间的连续密集奖励(dense reward)则能打破预训练分布的上限。后训练本质上是在预训练分布内重新分配概率质量,因此应跟踪模型产生目标行为的概率及输出熵。

所属事件:研究称密集奖励才能突破后训练性能天花板(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →