Does Multi-Agent Debate Improve AI Feedback on Research Papers?
Tomas Havranek, Zuzana Irsova
econ.GN, cs.CL, cs.MA
2026-07-16
让 44 篇论文的作者盲评三种 AI 评审,单次直出以 0.66 名次点胜出,花 35 倍成本的多智能体辩论双双落后;AI 评委还把真人审稿排最后。
多智能体辩论(multi-agent debate)是这两年很热的做法,让几个 AI 各自给观点再互相挑刺,最后综合出一个结论,直觉上应该比一个模型读一遍就输出更靠谱。把它用在给学术论文写评审意见上,效果到底是不是更好?这是个真问题:如果辩论式 AI 评审明显更强,审稿、科研反馈这类高价值场景就值得为它多付几十倍推理成本;如果并不更强,很多「智能体编排」可能只是在烧钱。
此前这类比较要么让 AI 当评委给自己打分(等于循环论证),要么不控制报告长度和格式,长报告天然占便宜。这篇把裁判权直接交给论文作者本人,并把所有报告锁死在同一个模板和同一字数预算里,只比内容。
作者找了 55 篇经济学元分析(27 篇是自己的,28 篇是外部作者的),最终 44 篇(80%)拿到至少一份排名。选元分析,是因为这类文章方法标准化、结论可核对,批评得对不对有客观参照。
三份 AI 评审报告长这样:
三份报告都套同一个模板、压到约 1000 词,来源线索(masking)打乱、呈现顺序随机,交给论文作者盲排「哪份对改进自己这篇最有用」。这是一次预注册(within-paper)实验,假设和分析方法事先写定。
还有一层:mad-research 和 paper-workshop 是作者自己造的工具,他们预期这两个赢。
作者把单次直出排在了第一,而且优势清晰:
| 报告 | 平均名次(越低越好) | 排第一的比例 |
| 单次直出 | 1.59 | 55% |
| paper-workshop | 2.16 | 27% |
| mad-research | 2.25 | 18% |
单次直出比 mad-research 好 0.66 个名次点(95% CI 0.32 到 1.00,Holm 校正 p=0.005),比 paper-workshop 好 0.57 个名次点(0.16 到 0.95,p=0.026)。两个辩论工具之间没有显著差别(差 0.09,p=0.75)。预注册的主假设「至少有一个辩论工具胜过单次直出」被否掉了。
成本是另一面。三者的钱数比大约是 1 : 9.2 : 35,paper-workshop 花了单次直出 35 倍的钱(约 7.2 美元对 0.2 美元)、近 30 倍的 token,换来的却是更差的作者评价。
第二个发现更麻烦。在作者还记得自己期刊审稿意见的那 21 篇里,真人审稿被作者排第一的比例是 71%,从不垫底。可换到 AI 评委这边,在有审稿意见可评的 26 篇上,78 次「评委×论文」打分里把真人审稿排最后的就有 75 次:Gemini 100% 垫底,Claude 96%、GPT 92%。AI 评委几乎在系统性贬低人类专家的意见。
第三个是 Gemini 反转。三份报告里单次直出和 paper-workshop 都是 Claude 写的,mad-research 用了多个家族,只有 Gemini 这个评委「自家没写任何一份」,算相对中立的裁判。可正是 Gemini 会把最费钱的 paper-workshop 排第一(平均名次 1.45,64% 排第一),要是让 Gemini 代替作者来排,结论会和作者完全反过来。作者与三个 AI 评委的秩相关也弱:Gemini τ=0.14(与零不可区分),GPT 0.27,Claude 0.20。
对做 agent 编排的人,这篇是个直接提醒:在「给已成稿的研究论文写反馈」这件事上,堆更多智能体、烧更多 token 不等于更好,而且这里输掉的不是某个强 baseline,是最朴素的「读一遍就写」。落地时,简单单次直出应当作为默认起点,辩论式或多智能体流程要先证明自己真的赚回了那 35 倍成本再上。
对把 AI 当评委的人,这篇是更强的警告。AI 评委跟人类作者的偏好弱相关,还会系统性地把真人审稿垫底。在「AI 能不能替人做学术裁判」上,证据指向「现在还不行」。别拿一个模型的偏好去替作者做判断,Gemini 那个反转就是个现成反例。
作者自己列了几条要害。一是把三份报告都压到约 1000 词,这可能天然偏袒单次直出,因为辩论工具平时的优势正在于更长更细的输出。二是只测了经济学元分析这一种体裁,而元分析恰恰是「结论可核对」的那类,辩论的价值可能更多在含糊、开放的问题上,这等于挑了辩论最没优势的场地来比。三是 paper-workshop 跑的是「轻量」配置,完整版没测。四是测的是作者「主观感知有用性」,不是论文按这些意见改完后真实变好了多少。
通读下来还有两点存疑。论文里各篇之间的评分一致性很弱(评委间成对秩相关平均 τ=0.049),说明这份排序本身噪声不小,0.66 个名次点的差距要稳妥解读。另外作者承认参与打分的人可能用了 AI 辅助排序,虽然与评委的低相关暗示他们大体是自己判断的,但这层不确定性没法完全排除。