新论文提出尾似然强化学习:均值奖励掩盖高价值输出概率差异

burkov · x · 2026-09-07

生成模型的强化学习通常最大化期望奖励,但均值相近的策略在产出稀有而高价值结果(上尾)的概率上可能差异巨大——训练或推理时增大采样量后,这一差距成为决定性因素。

论文提出 Tail-Likelihood Reinforcement Learning:不再优化单一均值,而是对奖励范围内的每个阈值,把「超过该阈值」视为二元成功事件,并在阈值上均匀取期望、最大化对数成功概率。该目标可分解为 Best-of-k 梯度的调和混合形式,从而在保持上尾覆盖的同时继续提升表现。

所属事件:CMU 等提出 TailRL:让强化学习看重尾部高奖励(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →