Tail-Likelihood Reinforcement Learning
Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar, Guanning Zeng, Qingyang Wu, Zhongzhu Zhou, Chenfeng Xu, Haiwen Feng, Yuda Song, Aarti Singh, Ruslan Salakhutdinov, J. Andrew Bagnell, Jeff Schneider, Andrea Zanette
cs.LG, stat.ML
2026-09-02
CMU提出TailRL:最大化超过随机奖励阈值的对数概率,只改advantage。代码优化Best-of-1024加速7.7倍,GRPO与RLOO塌成复制输入,迷宫在0.01%成功率下仍能学。
标准强化学习最大化期望奖励。对生成式策略来说,均值会把两件不同的事糊在一起:两个策略均值一样,产出罕见高分 rollout 的概率可以差很多。训练采样变多、推理 Best-of-k 变多时,真正有用的是高奖励那一侧还留着多少概率质量。
近期工作已经直接看到这个漏洞:常规 RL 会逐渐丢掉罕见高分轨迹,Best-of-k 跟着掉。高分一旦变得太稀,后续几乎采不到,策略改进就卡住。推理侧也一样,单次采样好看,多抽几次却几乎不涨。MaxRL 对二值奖励走了一步,最大化成功的对数概率,梯度变成 Pass@k 的调和混合。连续奖励还没有对应物。
TailRL 的起点很简单:每个奖励阈值都定义一次「成功」。奖励 r 超过 τ 的概率记成尾概率 pθ(x,τ)。期望奖励正好是这条尾概率曲线下面的面积,算术平均;TailRL 改成对 τ 均匀取样,最大化 log pθ(x,τ),几何平均。高阈值更难碰到,1/p 就把梯度压到更稀的那一侧。
梯度可以写成所有 Best-of-k 梯度的调和级数,1/k 权重自动来自对数,不用事先选定推理预算。二值奖励时,每个非平凡阈值都是同一件事,TailRL 精确退化成 MaxRL。
训练时一组 N 条 rollout 定义截断到 N 阶的目标:N=1 就是期望奖励,N→∞ 逼近总体目标。把奖励排序后,每个阈值把一份 credit 均分给超过它的样本,再沿阈值积分,得到无偏权重。实现上只换 advantage:组内中心化这些权重,就能塞进现成的 GRPO/RLOO 管线。
四个设定对应四种失败模式。
ImageNet 目标框定位用 IoU 作连续奖励。总体 TailRL 用闭式尾概率,[email protected] 和 @0.75 压过直接监督坐标的 L1+GIoU;均值 IoU 打平。有限样本估计随 N 增大,梯度余弦相似度逼近总体梯度。N=16 已经超过 N=1024 的 GRPO 和 RLOO。
文本迷宫用最短路成功当满分,失败给接近终点的部分分。初始最短路成功率从约 1% 降到 0.01% 时,GRPO 和 RLOO 学不稳,TailRL 还能抬 Pass@1。
GUI grounding 微调 Qwen2.5-VL-3B/7B,在 ScreenSpot-Pro 上测。Pass@1 和 RLOO 接近,但多抽时 TailRL 继续涨、RLOO 更早平台。3B 用 8 次采样追上 RLOO 的 Pass@1024,7B 用 4 次,分别少 128 倍和 256 倍推理 rollout。
代码运行时优化最能说明问题。PIE 语料上改慢 C++ 程序,正确且更快才给大于 1 的加速比。基座 74.4% 写错、23.5% 正确但不更快(堆在 1×)、只有 2.1% 真正加速。GRPO 和 RLOO 正确率冲到 98% 以上,均值奖励停在略低于 1,熵掉一到两个数量级,策略学会原样复制输入。TailRL 均值奖励到 2.92,测试集 Best-of-1024 加速 7.7 倍,对照是 0.98× 和 0.96×。训练只跑一个 epoch,TailRL 在第 300 步还在涨。
现成 RL 管线改 advantage 就能换目标,不用新超参、不用 critic。适合两类场景:高分轨迹存在但稀;以及有一条稳妥的中等奖励捷径会把探索吸干。推理侧要靠 Best-of-k 的人,训练时就该优化尾覆盖,事后再加多样性正则是补丁。
这是渐进改进里比较干净的一种:目标换了,实现几乎没换。
论文没有单独的局限节。几处需要自己掂量。GUI 奖励范围是 [0, 2.5],定位和迷宫才是 [0, 1],推广依赖附录里的有界奖励处理,主文没把缩放讲透。代码实验匹配计算量,不是收敛终点;更长训练 GRPO 会不会爬出复制捷径,没测。PKPO 要对一个选定的 kopt,和「所有 k 的调和混合」不是同一场比赛。迷宫优势集中在极低初始成功率,初始化变好之后差距收窄。四个任务都是可验证奖励,没有偏好模型或过程奖励。