新论文提出尾似然强化学习:均值奖励掩盖高价值输出概率差异
burkov · x · 2026-09-07
生成模型的强化学习通常最大化期望奖励,但均值相近的策略在产出稀有而高价值结果(上尾)的概率上可能差异巨大——训练或推理时增大采样量后,这一差距成为决定性因素。
论文提出 Tail-Likelihood Reinforcement Learning:不再优化单一均值,而是对奖励范围内的每个阈值,把「超过该阈值」视为二元成功事件,并在阈值上均匀取期望、最大化对数成功概率。该目标可分解为 Best-of-k 梯度的调和混合形式,从而在保持上尾覆盖的同时继续提升表现。
所属事件:CMU 等提出 TailRL:让强化学习看重尾部高奖励(3 条相关)→
「研究」频道最新
- scikit-learn 1.9 新增 metric_at_thresholds,一键寻找最优分类阈值 — GaelVaroquaux · 2026-09-08
- Codex 内 Astra agent 自主选出癌症测序关键变异,与研究者判断一致 — iskander · 2026-09-08
- 评测设计新主张:先搭真实世界,再由领域专家写任务 — Shahules786 · 2026-09-08
- David Silver 创业公司 Ineffable 新增六位联合创始人 — giffmana · 2026-09-08
- 用GRPO教9B小模型写Blender代码造低多边形房间,踩坑全记录 — TheMoonMidas · 2026-09-08
- 2026 PNPL 竞赛:用 MEG 数据推进无创语音解码脑机接口 — pnpl · 2026-09-08