TailRL 优化奖励尾部概率,GUI 定位样本省 256 倍

burny_tech · x · 2026-09-07

CMU 等机构研究者提出 Tail-Likelihood RL(TailRL),针对标准 RL 只优化平均奖励、会压制罕见但高质量输出的缺陷,改为最大化策略超过随机奖励阈值的对数概率,让梯度更侧重稀有高奖励 rollout,可解释为跨所有 k 的 Best-of-k 梯度混合。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →