CMU 等提出 TailRL:强化学习转向优化奖励尾部
CMU 的 Ruslan Salakhutdinov 等人发布论文 Tail-Likelihood Reinforcement Learning(TailRL),针对标准 RL 只优化平均奖励、会压制罕见但高质量输出的缺陷,改为最大化策略超过随机奖励阈值的对数概率,让训练看重尾部高奖励样本。实验中借助 GUI 定位样本即可节省 256 倍开销。
2026-09-07 ~ 2026-09-07 · 2 条相关
- TailRL 优化奖励尾部概率,GUI 定位样本省 256 倍 — burny_tech · 2026-09-07
- Salakhutdinov 团队提出 TailRL:让 RL 看重尾高奖励样本而非只追均值 — burny_tech · 2026-09-07