TailRL 优化奖励尾部概率,GUI 定位样本省 256 倍
burny_tech · x · 2026-09-07
CMU 等机构研究者提出 Tail-Likelihood RL(TailRL),针对标准 RL 只优化平均奖励、会压制罕见但高质量输出的缺陷,改为最大化策略超过随机奖励阈值的对数概率,让梯度更侧重稀有高奖励 rollout,可解释为跨所有 k 的 Best-of-k 梯度混合。
- 只需简单修改优势函数,可兼容现有 RL 训练管线
- 在物体定位、迷宫导航、GUI grounding、代码优化等任务上,帮助模型保留探索、避免次优解,并更好地从推理时增加采样中获益
- GUI grounding 上样本需求最多减少 256 倍,代码优化的 Best-of-1024 场景提速 7.7 倍
- 代码开源于 Zanette-Labs/TailRL
「研究」频道最新
- MUCG 多模态统一理解与生成研讨会将亮相 ECCV 2026 — jmin__cho · 2026-09-07
- 雷达点云分类:点密度才是瓶颈,F1 从 0.381 翻倍至 0.764 — bruno_pinto90 · 2026-09-07
- AI 数学播客对话 CMU 教授 Avigad:数学能否被自动化 — EchoShao8899 · 2026-09-07
- 「The honest claim」成预印本高频词,暴露AI代写痕迹 — lpachter · 2026-09-07
- ML 研究可复现性正走向失效:三大诱因讨论引热议 — NeighborhoodFatCat · 2026-09-07
- GPT Astra 三试其一解决 1962 年 Erdős–Sós 猜想,仅花 363 美元 — burny_tech · 2026-09-07