CMU 提出 TailRL:优化奖励上尾概率,让 RL 少陷次优解
ceciletamura · x · 2026-10-05
CMU 团队(含 Salakhutdinov、Bagnell、Zanette 等)在 arXiv 发表论文《Tail-Likelihood Reinforcement Learning》(TailRL)。
核心问题:RL 通常只优化平均奖励,但对生成式策略而言,两个平均奖励相同的策略,产生「稀有高奖励」轨迹的概率可能差异巨大——而这种尾部覆盖能力恰恰决定了训练与推理时增加采样次数的收益。
方法要点:
- 把连续奖励转化为一族二元成功事件:对每个奖励阈值,问策略超过它的概率有多大
- TailRL 最大化「超过随机选定奖励阈值」的对数概率,梯度会给稀有高奖励样本更高权重,可解释为 Best-of-k 梯度的混合
- 只需对优势函数做简单修改,兼容现有 RL 训练流程
在物体定位、迷宫导航、GUI grounding、代码优化等任务上,TailRL 利用稀有高奖励训练样本避免陷入次优解,且模型更能从推理时的额外采样中受益。
「研究」频道最新
- Neural SDE 直接学物理时间动态,天气预报可提前 5 天出概率预测 — canaesseth · 2026-10-05
- 开发者开源欧洲语言 PII 脱敏模型,附训练与服务优化全记录 — auto_grad_ · 2026-10-05
- Meta 发布 NAVA-WAM:纯视频预训练机器人动作策略,摆脱动作标注依赖 — meta · 2026-10-05
- 开源 Rust 引擎 gamfit:一条公式拟合 GAM,自动选平滑参数 — Sauers_ · 2026-10-05
- Llama 3.1 8B 微调医疗决策模型:逐字段准确率 84%,全对仅 30% — Forsaken_Cut8542 · 2026-10-05
- 上海交大发布 LIFT:VLA 零力标注预训练,后训练注入力觉高频反应 — jiqizhixin · 2026-10-05