Salakhutdinov 团队提出 TailRL:让 RL 看重尾高奖励样本而非只追均值
burny_tech · x · 2026-09-07
Ruslan Salakhutdinov 等人发布新论文 Tail-Likelihood Reinforcement Learning(TailRL),试图回答一个根本问题:RL 是否在优化正确的目标?
- 动机:标准 RL 只优化平均奖励,策略分布往往坍缩成一个尖峰,稀有但高奖励的 rollout 的概率质量被耗尽;而在推理时增加采样能否受益,恰恰取决于策略是否保留了对高奖励结果的覆盖。
- 方法:TailRL 把连续奖励转化为「超过随机选定的奖励阈值」的一系列二元成功事件,最大化超越阈值的对数概率期望,从而在追均值的同时最大化高奖励输出的覆盖;其梯度天然给稀有高奖励样本更大权重,可解释为 Best-of-k 梯度的混合。
- 工程友好:只需对 advantage 函数做简单修改即可接入现有 RL 流水线。
- 实验:在物体定位、迷宫导航、GUI grounding、代码优化四类任务上,TailRL 能有效利用稀有高奖励样本,且随推理时采样量增加扩展性更好。
论文:arXiv 2609.02987,作者含 Andrea Zanette、Aarti Singh、J. Andrew Bagnell 等。
所属事件:CMU 等提出 TailRL:强化学习转向优化奖励尾部(2 条相关)→
「研究」频道最新
- 结构上杜绝编造引用:开源文献综述流水线放出完整演示视频 — Waste_Public_2985 · 2026-09-07
- Toby Ord 论照片的信息量:一张照片最多传约 340 比特 — tobyordoxford · 2026-09-07
- Sierra 发布 τ^τ-Bench:让编码智能体真实搭建客服 Agent 的评测环境 — sierra-research · 2026-09-07
- Enoki:共享关系事实统一事实核验与幻觉定位,省资源还提准 — s-nlp · 2026-09-07
- 一张照片只有 42 字节信息?Oxford 学者与 Redwood 研究员激辩 — tobyordoxford · 2026-09-07
- 作者用 bandit 模型演示:用户习惯如何压过产品真实质量 — svk_roy · 2026-09-07