AI 年度十佳论文揭晓:Rulin Shao 一人独占两篇,皆为一作
ShayneRedford · x · 2026-10-07
一份「AI's Top 10」论文榜单按一作署名公布,斯坦福研究员 Rulin Shao 以两篇论文上榜,自嘲对人类奖项命中率 50%。
- 榜单论文包括:Spurious Rewards(Rethinking Training Signals in RLVR)、Learning to Discover at Test Time、Revisiting Efficiency–Accuracy Scaling in MoE、Reinforcement Learning via Self-Distillation、Maximum Likelihood Reinforcement Learning 等
- Shao 的第二篇上榜作为 Reinforcement Learning with Evolving Rubrics for Deep Research
- 其余涉及 AutoNumerics-Zero、LLM 强化学习中信任域的重新思考、大规模 Gromov-Wasserstein 等方向
- 上榜主题集中在 RLVR/RL 训练信号与 MoE 扩展性等当前热点
所属事件:RL 研究年度十佳论文榜公布,Spurious Rewards 居首(2 条相关)→
「研究」频道最新
- 研究者提出 World Editing:不生成新世界而是编辑已有世界 — yuntiandeng · 2026-10-07
- 新研究追问:Agent 替你行动时,它到底站在谁那边 — ZacharyHuang12 · 2026-10-07
- RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首 — ShayneRedford · 2026-10-07
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- SciConHarness 屏蔽答案来源,逼模型真合成而非检索 — manoelribeiro · 2026-10-07