CMU 等提出 TailRL:强化学习转向优化奖励尾部

CMU 的 Ruslan Salakhutdinov 等人发布论文 Tail-Likelihood Reinforcement Learning(TailRL),针对标准 RL 只优化平均奖励、会压制罕见但高质量输出的缺陷,改为最大化策略超过随机奖励阈值的对数概率,让训练看重尾部高奖励样本。实验中借助 GUI 定位样本即可节省 256 倍开销。

2026-09-07 ~ 2026-09-07 · 2 条相关