CMU 提出 TailRL:优化奖励上尾概率,让 RL 少陷次优解

ceciletamura · x · 2026-10-05

CMU 团队(含 Salakhutdinov、Bagnell、Zanette 等)在 arXiv 发表论文《Tail-Likelihood Reinforcement Learning》(TailRL)。

核心问题:RL 通常只优化平均奖励,但对生成式策略而言,两个平均奖励相同的策略,产生「稀有高奖励」轨迹的概率可能差异巨大——而这种尾部覆盖能力恰恰决定了训练与推理时增加采样次数的收益。

方法要点:

在物体定位、迷宫导航、GUI grounding、代码优化等任务上,TailRL 利用稀有高奖励训练样本避免陷入次优解,且模型更能从推理时的额外采样中受益。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →