ICML自评最高稿16个月引用翻倍,拒稿组审稿分失效

2026-09-02

宾大等在ICML 2023让1342位作者私下给多稿排序。16个月后,自评最高稿平均引用约是最低稿的两倍;拒稿组里审稿分几乎分不出日后引用,自评排序可以。

这篇在解决什么

Nature Computational Science 这篇是纽约大学阿布扎比分校 Bedoor AlShebli 给一篇实验写的 News & Views。被评的原实验来自宾夕法尼亚大学 Buxin Su、Bingxin Zhao、Weijie Su 等人:在 ICML 2023 让作者私下给自己的多篇投稿排序,再看这个排序能不能预测日后引用,以及它是否比审稿分更稳。

AI 顶会审稿已经被规模压住。ICML 投稿从 2017 年的 1676 篇涨到 2025 年的 12107 篇,NeurIPS 同期从 3240 涨到 21575。有经验的审稿人没跟上,会议越来越依赖研究生、本科生,也开始用语言模型辅助审稿。NeurIPS 2021 的一致性实验里,大约一半录用论文在第二套独立审稿下会被拒。

审稿人时间紧,更容易给「benchmark 涨了几个点」打高分,不太容易判断一篇工作三年后还值不值得跟。作者对自己工作的概念深度和长期潜力更清楚,但直接问「你这篇有多好」会灌水。要测的是:只让作者在自己的多篇投稿里排相对名次,这个相对判断里有没有真信息。

方法

ICML 2023 共 6538 篇投稿、18535 位作者。截稿日 2023 年 1 月 26 日之后,会议官方通过 OpenRank.cc 发问卷,2 月 10 日截止,早于审稿意见发回。有多稿的作者按感知质量拖拽排序。问卷写明:排序不会给合作者、审稿人、AC 或 PC 看,也不进入当年录用决定。任务没有被表述成预测录用或预测引用。

5634 人填了问卷(作者的 30.4%),其中 1342 人给出多稿排序,覆盖 2592 篇(全部投稿的 39.6%)。审稿分是 1–10 分,分 rebuttal 前和 rebuttal 后两套。引用窗口是 2023 年 7 月 23 日到 2024 年 11 月 22 日,共 16 个月,主数据来自 Semantic Scholar,标题和作者列表用编辑距离不超过 20 对齐。最终分析集是 797 位作者、1527 篇能对上引用记录的投稿。主比较在同一作者作品集内部:最高排序对最低排序,再按录用或拒稿分层,用双侧配对 Wilcoxon 符号秩检验。

设计要点是比较,不是打分。作者不能把每篇都标成最好。Weijie Su 此前提出的 isotonic mechanism(保序机制)从博弈论上说明,在一定条件下这种相对排序是激励相容的。

结果

全体样本里,自评最高稿平均 19.99 次引用,约是最低稿的两倍(P < 0.001)。按录用结果切开,倍数几乎不变:

分组高自评均值低自评均值倍数Wilcoxon P
录用(n=280 对)27.6413.822.006.00×10⁻³
拒稿或撤稿(n=343 对)12.426.361.95< 0.001

审稿分做不到同样的事。录用组里,rebuttal 后高分对低分的引用差显著(P = 6.66×10⁻³),rebuttal 前分数并不显著(P = 0.112)。拒稿组里两套分数都不显著(P = 0.890 和 0.556)。自评排序是唯一在录用和拒稿两侧都站得住的信号。

尾巴更明显。超过 150 次引用的 22 篇里,17 篇(77.27%)被至少一位作者排第一。这 22 篇约占分析集的 1.44%,接近顶会 oral 比例。35 次引用阈值上,高自评稿有 17.14% 超过,低自评稿只有 6.79%;100 次引用上是 4.29% 对 1.43%。引用最高的那篇拿到 979 次,作者排第一,rebuttal 后只打了 5 分,以 poster 录用。

控制审稿分、confidence、录用结果、作品集大小之后,负二项回归里,从作者最低稿换到最高稿,期望引用仍是 1.81 倍。500 次 holdout 预测 top 四分位,自评 precision / recall 为 0.318 / 0.307,略高于 rebuttal 后分数的 0.307 / 0.297。GitHub star 方向一致:录用 755.15 对 347.48,拒稿 89.77 对 33.27。去掉自引、卡相近 arXiv 时间后差距还在。

对照把判断来源拆开。GPT-4o mini 给 263 对录用稿做文本排序,模型偏爱的那边平均 21.69 次引用,另一边 19.61;同一批配对上,作者排序是 27.00 对 13.82。比较格式本身不够,谁来比才是关键。

为什么重要

对顶会组织者,这是一个几乎零成本的旁路信号:作者反正已经投了多篇,拖一次排序即可。ICML 2026 已经拿来用了。rebuttal 前分数出来后,用 isotonic mechanism 算出与作者排序一致的投影分,投影分和原始分差得大的大约 1000 篇被标成 disagreement,给 AC 和 SAC 看,不标明方向,用来催紧急审稿或重读已有意见。

对投稿人更具体:审稿分低、作者自己排第一的稿,不一定是水。979 引那篇就是 poster 加 5 分。这是渐进改进,不是换掉 peer review。原实验自己写了:排序是针对性的侧面信息,用来找奖项候选或该加审的稿,不替代审稿人对正确性的判断。

局限与存疑

引用是影响的代理,不是质量。引用可以是批评,也可以是跟风;16 个月对真正慢热的工作偏短。分析只覆盖自愿填问卷、且有多稿的作者,单稿作者完全不在样本里。30.4% 的回收率会选出更愿意表达相对判断的人。所有稿都已经过了作者自己的投稿门槛,推不到没投出去的想法。

观测设计消不掉残余混淆。如果排序真的开始影响录用,作者激励会变,激励相容的理论保证不一定还成立。GPT 对照只用了 GPT-4o mini、263 对录用稿,不能外推到更强模型和全量投稿。相关实验已在 ICML 2024、2025 和 NeurIPS 2025 做了,那些稿还要时间攒引用。

AlShebli 这篇 News & Views 本身在付费墙后,能核到的只有摘要、图注和 7 条参考文献。上面的数字和方法细节来自它评的开放获取原文 Su 等人 2026 年的 Brief Communication。

术语

原文与代码

社区讨论

全部论文解读