4 万 LLM 智能体模拟学术圈:拒稿重投让审稿负担涨到 3.2 倍

Science Utopia? Closed-Loop LLM Simulation of Academic Research Ecosystems

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Bing He, Siheng Xiong, Yijia Xiao, B. Aditya Prakash, Josiah Hester, Srijan Kumar, James Evans, Jindong Wang

cs.CL, cs.AI, cs.CY

2026-10-01

SUTO 用 4 万 LLM 智能体闭环模拟学术界十年:重投让人均审稿量升至 6.64 篇,投稿上限翻倍论文增六成,十年存活率 39%→24%。

这篇在解决什么

AI 正在进入科研的每个环节:选题、实验、写稿、审稿。但单环节的改进加起来,不等于一个更健康的科学生态。录取率、经费规则、重投制度会互相反馈,效应拉长到十年才显形,而真实学术界做不了这种对照实验,没人能随机改一个会议的录取率再观察十年。已有两条路线各有缺口:AI Scientist 一类系统做单点任务,没有持久状态和反馈;传统 agent-based model 用简单规则研究科学社会学,缺真实科学内容。SUTO 补的就是这个空档。

方法

SUTO(Georgia Tech、UChicago、William & Mary 等机构,代码已开源)把一个模拟年拆成六个阶段:选题与合作、投稿与引用、同行评审、录用与记忆更新、经费分配与流失、重投。

规模:61 个模拟世界、4 万+ researcher、8000 个机构,累计约 40 万次投稿决定和 120 万篇 LLM 评审。

结果

对比设置指标结果
仅人口增长 / 基线人均年审稿量2.25 / 2.07
仅开放重投人均年审稿量6.64
录取率固定 30% vs 按 ACL 降到 20.3%十年投稿增长 / 审稿工作量282% vs 358%,更严者多 14%
投稿上限 1→2 篇,经费随需求扩录用论文 / 十年存活率+69%,49%→29%
投稿上限 1→2 篇,经费固定录用论文 / 十年存活率+63%,39%→24%
explorer / cautious explorer / exploiter录取率29.8% / 37.2% / 39.2%
双盲 vs 公开一作姓名与机构评审分(1-5 分制)+0.0550.077

重投是审稿负担的主引擎。人口增长会同步扩容审稿池,人均负担几乎不动;只开重投,人均审稿量冲到 6.64。更严的录取标准在首投量几乎不变的前提下,仍把总审稿工作量推高 14%,被拒的稿子把审稿劳动堆积到后续轮次;人口增长加重投的联合条件下,第十年重投占当年投稿的 61%。

产量增长会掩盖参与度坍缩。投稿上限翻倍,论文多六到七成,但经费固定时十年存活率从 39% 掉到 24%,经费随需求扩容也救不回来,49% 掉到 29%。混合人群里工业研究员从 87% 掉到 56%。经费从随需求扩改为固定后,从未获资助的比例从 22% 升到 37%,受资助者内部 Gini 只从 0.36 微涨到 0.39:稀缺表现为更多人出局,不是少数人更富。

慢探索是个体性价比最高的策略:cautious explorer(在既有专业附近开新方向)录取率只比深挖旧方向的 exploiter 低 2 个百分点,引用影响力反而更强,十年存活率与 exploiter 同在 53% 上下,远探索的 explorer 只剩 41.1%,做出高影响力论文的概率也最低(0.62,另两类策略为 0.81 与 0.84)。生态层面,慢探索占多数的世界比深挖占多数的主题熵高 0.11、多 8.5 个活跃方向。两个反直觉结果:论文离作者既有轨迹越远越难发(录取率 48.0%→21.8%),但发出来的三年均引从 0.95 涨到 1.98;换自己的方向不等于改变领域方向,CD index 为正的比例在 explorer 组最低(39.8%)。

无干预的大世界里,经费 Gini 十年从 0.04 涨到 0.36,活跃人口从 5000 缩到约 2530,但 53 个研究方向全部有人在做:资源集中和智力多样性是脱钩的。窄胜早期经费在后续三年没有带来可检测的累积优势。评审侧还有一条:公开一作姓名与机构,LLM 评审分涨 0.0550.077,再叠加合作关系信息几乎没有额外影响。

为什么重要

这是一个科学政策风洞:改一条规则、跑十年、看长程后果,现实里做不到。做 AI-for-science 的人可以直接拿它压测自己的工具,比如 AI 提产之后评审系统会不会先崩;政策侧更该看「产量涨、参与度跌」这条:喊 AI 提速科研之前,先问评审和资助容量跟上了没有。也要直说,这些数字是 LLM agent 涌现行为的产物,属于假想实验,不是对真实学术界的测量。

局限与存疑

脚注里作者承认,没有真正模拟「写本子-评审-资助」的提案管线,只假设发表记录与提案评估正相关,经费结论因此偏简化。预算被定义成抽象资源(作者类比 AI token),流失率对这个参数化高度敏感,正文没有给敏感性分析。评审全部由 LLM 生成,公开作者信息的加分效应测的是 LLM 评审的偏差,不能直接外推到人类审稿人。模拟与真实学界数据之间也没有系统性校准。「窄胜无累积优势」这类否定性结论依赖具体机制设定,换一个资助模型可能翻转。

术语

原文与代码

相关论文

全部论文解读