让 AI 当 ICML 领域主席:全量 6617 篇论文排名与人类严重分歧
Shayne Redford 与 Seungone Kim 团队开展「AI as Area Chair」试点研究:让语言模型扮演领域主席,在不看作者和人类评审分数的情况下,对 ICML 2026 全部 6617 篇录用论文进行匿名排名,并与人类 AC 的 oral/spotlight 决策对比,以此探究 AI 的「研究品味」与人类研究者的差异。
已确认
- AI 排名前十以强化学习方向论文为主,《Spurious Rewards: Rethinking Training Signals in RLVR》登顶,自蒸馏强化学习相关研究也在列
- 分歧幅度惊人:人类评选的 oral 中只有约四分之一进入 AI 排名前 10%;主赛道全体论文上,AI 排名与 oral/spotlight 层级及评审分数的一致性(Kendall's τ)仅约 0.08
- 转述方对研究发现的补充归纳:AI 评审高度受线上热度(hype)影响,偏好「感知影响力大、泛化性强」的研究
- 作者澄清研究立场:并非提倡让 AI 担任 AC;AI 已深度介入头脑风暴、写作、评审与修改等科研环节,研究目的是让后果可见,包括给科学引入统一、系统性偏见的风险
- 作者列出研究局限:仅覆盖已录用论文、结果依赖所用的模型与设置
为什么重要
随着 AI agent 越来越多参与科研流程,若模型带着一致而系统性的「口味」影响选题、评审与写作,可能在学界形成同质化偏见。该研究首次在顶会全量论文尺度上量化了这种分歧,为讨论 AI 介入同行评审的风险提供了数据基础。
2026-10-07 ~ 2026-10-07 · 6 条相关
一手来源
- 让 AI 当 Area Chair:给 ICML 全部 6617 篇论文排名,与人类选择严重分歧 — ShayneRedford ·
- AI 审稿与人类分歧惊人:人类 oral 仅四分之一进入 AI 前 10% — ShayneRedford ·
- AI 审稿研究作者声明:不提倡 AI 当 AC,而是警示系统性偏见风险 — ShayneRedford ·
- 【源头】让 AI 当 Area Chair:给 ICML 全部 6617 篇论文排名,与人类选择严重分歧 — ShayneRedford · 2026-10-07
- AI AC 榜单 Top 10:RLVR 训练信号研究登顶,自蒸馏强化学习在列 — ShayneRedford · 2026-10-07
- 【源头】AI 审稿与人类分歧惊人:人类 oral 仅四分之一进入 AI 前 10% — ShayneRedford · 2026-10-07
- 【源头】AI 审稿研究作者声明:不提倡 AI 当 AC,而是警示系统性偏见风险 — ShayneRedford · 2026-10-07
- 试点研究:让 AI agent 给 ICML 2026 全部论文打分,口味与人类不同 — ShayneRedford · 2026-10-07
- AI 给 ICML 2026 全部 6617 篇论文评分:与人类评审显著分歧 — ShayneRedford · 2026-10-07