研究称密集奖励才能突破后训练性能天花板
一篇探索语言模型 RL 后训练(RLVR)的论文在简化设置下得出关键结论:使用 0 或 1 的稀疏奖励效果较差,若奖励信号对应的行为模型从未采样过,再正确也无法学到;而 0 到 1 之间的密集奖励能够提供更平滑的学习信号,帮助模型突破后训练的性能天花板,找到原本采样不到的新行为。
2026-08-27 ~ 2026-08-28 · 2 条相关
- RLVR 论文:稀疏奖励挖不出模型采不到的行为,密集奖励才能破顶 — iScienceLuvr · 2026-08-27
- 研究称密集奖励能突破后训练天花板,稀疏奖励失效 — joecole · 2026-08-28