RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首
ShayneRedford · x · 2026-10-07
一份「AI's Top 10」研究榜单列出十篇 RL 相关论文并署名一作:1) Spurious Rewards: Rethinking Training Signals in RLVR;2) Learning to Discover at Test Time;3) Revisiting Efficiency–Accuracy Scaling in MoE Architectures;4) RL via Self-Distillation;5) Maximum Likelihood RL;6) AutoNumerics-Zero;7) RL with Evolving Rubrics for Deep Research;8) Rethinking the Trust Region in LLM RL;9) Gromov-Wasserstein at Scale;10) Flowers: A Warp Drive for Neural PDEs。多位作者转发庆祝上榜。
所属事件:RL 研究年度十佳论文榜公布,Spurious Rewards 居首(2 条相关)→
「研究」频道最新
- GroundedSLAM 发布:大幅刷新 Meta 第一人称 SLAM 基准 — Scobleizer · 2026-10-07
- HCI 学者吐槽:别把归纳式主题分析冒充「反身性」分析 — IanArawjo · 2026-10-07
- Reza Zadeh 称找到更快矩阵乘法算法,猜测大厂已接近指数 2 — Reza_Zadeh · 2026-10-07
- Reddit 网友提出图式确定性建模,解决 LLM 金融计算不可信难题 — jonnylegs · 2026-10-07
- COLM 2026 海报:面向智能体编程的测试时算力扩展研究亮相 — dan_fried · 2026-10-07
- COLM 2026 高效推理研讨会周五举行,含分论坛讨论 — tydsh · 2026-10-07