研究称密集奖励才能突破后训练性能天花板

一篇探索语言模型 RL 后训练(RLVR)的论文在简化设置下得出关键结论:使用 0 或 1 的稀疏奖励效果较差,若奖励信号对应的行为模型从未采样过,再正确也无法学到;而 0 到 1 之间的密集奖励能够提供更平滑的学习信号,帮助模型突破后训练的性能天花板,找到原本采样不到的新行为。

2026-08-27 ~ 2026-08-28 · 2 条相关