Salakhutdinov 团队提出 TailRL:让 RL 看重尾高奖励样本而非只追均值

burny_tech · x · 2026-09-07

Ruslan Salakhutdinov 等人发布新论文 Tail-Likelihood Reinforcement Learning(TailRL),试图回答一个根本问题:RL 是否在优化正确的目标?

论文:arXiv 2609.02987,作者含 Andrea Zanette、Aarti Singh、J. Andrew Bagnell 等。

所属事件:CMU 等提出 TailRL:强化学习转向优化奖励尾部(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →