ICML 作者自评最高的论文,16 个月引用约是最低稿的两倍

2026-08-25

ICML 2023 上 1342 名作者给 2592 篇投稿排序。16 个月内自评最高稿引用约是最低稿的两倍,比审稿分更能抓住高被引,ICML 2026 已用它标出约 1000 篇审稿分歧稿。

这篇在解决什么

AI 顶会投稿量把同行评审压变形了。ICML 从 2017 年 1676 篇涨到 2025 年 12107 篇,NeurIPS 同期从 3240 涨到 21575。有经验的审稿人没同比例增加。会议越来越依赖没在这些会发过文的学生,以及语言模型辅助审稿。NeurIPS 2021 的重复评审实验里,大约一半已被接收的论文在第二套独立审稿下会被拒。审稿还能拦明显错误。在紧截止日期里,更容易打分的是 benchmark 涨了多少,不是一篇工作三年后还值不值得跟。

宾夕法尼亚大学的 Buxin Su、Bingxin Zhao、Weijie Su 等人换了一个信号:让同一会议上投了多篇的作者,给自己的稿子排序。绝对打分人人都想打满分;排序强迫他们说出相对高低。博弈论上,在一定条件下这种比较更接近诚实。ICML 2023 组委会批准后,调查在审稿放出前做完。

方法

OpenReview 上 6538 篇投稿、18535 名作者。截稿次日(2023 年 1 月 26 日)全员收到 OpenRank.cc 问卷,2 月 10 日关闭,此时作者还没看到审稿。5634 人回应(30.4%),其中 1342 名多稿作者给出排序,覆盖 2592 篇(39.6%)。问卷写明排序不给合作者、审稿人、AC 看,也不影响 2023 年的接收。任务是按「感知质量」拖拽排序,没有要求预测引用或中稿。

引用取 Semantic Scholar,窗口是 2023 年 7 月 23 日到 2024 年 11 月 22 日,约 16 个月。标题和作者列表的 Levenshtein 距离都不超过 20 才对齐。最终分析集:797 名作者、1527 篇独特投稿。篇均引用 14.73,中位 4,75 分位 11,最高 979。

主分析在同一作者、同一决策结果内部,比最高稿和最低稿。接收含 poster 和 oral,拒稿含撤回和 desk reject。280 名作者有多篇接收,343 名有多篇拒稿。对照是同一作者的预 rebuttal / 后 rebuttal 审稿分(1–10 分)。负二项回归用 2096 条作者–投稿观测,控制审稿分和信心、最终决策、作品集大小、审稿人数、排序是否完整。另做 500 次类别平衡的 holdout,预测引用最高四分位。

结果

自评最高稿平均 19.99 次引用,约是最低稿的两倍(配对 Wilcoxon,P<0.001)。按接收/拒稿切开,比值几乎不变:

分组自评最高自评最低倍数
接收27.6413.822.00
拒稿12.426.361.95

接收组里,后 rebuttal 审稿分也能分开引用(P=6.66×10⁻³)。拒稿组里两种审稿分都不显著,自评排序仍然显著(P<0.001)。作者在同一决策组内排了至少三篇时,接收稿按第 1、2、3、末位的均引是 41.57、19.39、14.32、12.83。

尾巴更明显。22 篇引用超过 150 的投稿里,17 篇被至少一位作者排第一;15 篇接收、7 篇拒稿,其中 4 篇拒稿仍被排第一。超过 35 次引用的比例:最高稿 17.14%,最低稿 6.79%;超过 100 次:4.29% 对 1.43%。接收组最高引用 979,约是最低组最大值 331 的三倍。

负二项全模型里,从作者最低稿走到最高稿,期望引用乘 1.81。holdout 上自评指示的 precision/recall 是 0.318/0.307,后 rebuttal 分是 0.307/0.297。这是增量信息,单独当分类器不够,论文自己也这么写。GitHub star 方向一致:接收最高 755.15 对最低 347.48。用 GPT-4o mini 给 263 对接收稿排序,模型偏好稿均引 21.69 对 19.61,同一批里作者排序是 27.00 对 13.82。

排除自引、卡审稿分区间、对比 arXiv 挂出日期(最高稿平均 3 月 4 日,最低稿 3 月 8 日)、看会议开始后头两个月(接收最高 1.65 对最低 0.69),方向都还在。头两个月的差距很难用会场曝光解释,因为随后引用它的论文通常要几个月才出现。

为什么重要

对顶会组织者,这是一个几乎零成本的侧信道:作者已经知道哪篇更「值钱」,赶工的审稿人不一定知道。论文主张拿它当补充,用来找奖项候选,或标出作者判断和审稿分打架的稿子,不要替代审稿。ICML 2026 已经按 2023 年结果落地:用 isotonic 机制把排序和审稿分合成投影分,约 1000 篇高分歧稿被标给 AC,大约每人一篇,可加急审或重读,不告诉 AC 分歧朝哪边。

对投稿人,数字也冷。引用不是正确性。7 篇超 150 引的稿被拒了。自评预测的是后来有没有人跟,不是该不该中。benchmark 涨点仍然更容易过审;概念上更「值」的稿,作者自己往往排得更高。

局限与存疑

样本是自愿填问卷、且投了多篇的人,泛化不到单稿作者和其他学科。只覆盖已经决定投稿的工作,没有覆盖没写出来的想法。观测设计消不掉剩余混杂:同一作者的「最好稿」也可能更会做宣传、更靠近热门方向。他们查了挂出日期和会议曝光,不能穷尽。如果排序开始影响决策,激励会变,诚实性需要机制来保,不能默认还和 2023 年保密问卷一样。

引用窗口只有 16 个月,对慢热理论稿不公平。GitHub star 受领域软件化程度摆布,作者当描述统计而非主结论。GPT-4o mini 那组只是诊断,不是「LLM 当审稿人」的评测。ICML 2024/2025 和 NeurIPS 2025 做了后续实验,那些稿还没积累够引用。最大的概念风险:把引用当「科学潜力」的代理,会把会议优化目标悄悄改成可被引性。

术语

原文与代码

社区讨论

全部论文解读