RL 研究年度十佳论文榜公布,Spurious Rewards 居首

一份「AI's Top 10」研究榜单公布十篇强化学习相关年度论文,按一作署名排列,其中 Spurious Rewards: Rethinking Training Signals in RLC 位列榜首。斯坦福研究员 Rulin Shao 一人独占两篇且均为一作,他自嘲对人类奖项的命中率为 50%,榜单发布后引发社区关注。

2026-10-07 ~ 2026-10-07 · 2 条相关