自建多智能体辩论本想胜出,却被 1/35 成本的单次直出反超

Does Multi-Agent Debate Improve AI Feedback on Research Papers?

Tomas Havranek, Zuzana Irsova

econ.GN, cs.CL, cs.MA

2026-07-16

让 44 篇论文的作者盲评三种 AI 评审,单次直出以 0.66 名次点胜出,花 35 倍成本的多智能体辩论双双落后;AI 评委还把真人审稿排最后。

这篇在解决什么

多智能体辩论(multi-agent debate)是这两年很热的做法,让几个 AI 各自给观点再互相挑刺,最后综合出一个结论,直觉上应该比一个模型读一遍就输出更靠谱。把它用在给学术论文写评审意见上,效果到底是不是更好?这是个真问题:如果辩论式 AI 评审明显更强,审稿、科研反馈这类高价值场景就值得为它多付几十倍推理成本;如果并不更强,很多「智能体编排」可能只是在烧钱。

此前这类比较要么让 AI 当评委给自己打分(等于循环论证),要么不控制报告长度和格式,长报告天然占便宜。这篇把裁判权直接交给论文作者本人,并把所有报告锁死在同一个模板和同一字数预算里,只比内容。

方法

作者找了 55 篇经济学元分析(27 篇是自己的,28 篇是外部作者的),最终 44 篇(80%)拿到至少一份排名。选元分析,是因为这类文章方法标准化、结论可核对,批评得对不对有客观参照。

三份 AI 评审报告长这样:

三份报告都套同一个模板、压到约 1000 词,来源线索(masking)打乱、呈现顺序随机,交给论文作者盲排「哪份对改进自己这篇最有用」。这是一次预注册(within-paper)实验,假设和分析方法事先写定。

还有一层:mad-research 和 paper-workshop 是作者自己造的工具,他们预期这两个赢。

结果

作者把单次直出排在了第一,而且优势清晰:

报告平均名次(越低越好)排第一的比例
单次直出1.5955%
paper-workshop2.1627%
mad-research2.2518%

单次直出比 mad-research 好 0.66 个名次点(95% CI 0.32 到 1.00,Holm 校正 p=0.005),比 paper-workshop 好 0.57 个名次点(0.16 到 0.95,p=0.026)。两个辩论工具之间没有显著差别(差 0.09,p=0.75)。预注册的主假设「至少有一个辩论工具胜过单次直出」被否掉了。

成本是另一面。三者的钱数比大约是 1 : 9.2 : 35,paper-workshop 花了单次直出 35 倍的钱(约 7.2 美元对 0.2 美元)、近 30 倍的 token,换来的却是更差的作者评价。

第二个发现更麻烦。在作者还记得自己期刊审稿意见的那 21 篇里,真人审稿被作者排第一的比例是 71%,从不垫底。可换到 AI 评委这边,在有审稿意见可评的 26 篇上,78 次「评委×论文」打分里把真人审稿排最后的就有 75 次:Gemini 100% 垫底,Claude 96%、GPT 92%。AI 评委几乎在系统性贬低人类专家的意见。

第三个是 Gemini 反转。三份报告里单次直出和 paper-workshop 都是 Claude 写的,mad-research 用了多个家族,只有 Gemini 这个评委「自家没写任何一份」,算相对中立的裁判。可正是 Gemini 会把最费钱的 paper-workshop 排第一(平均名次 1.45,64% 排第一),要是让 Gemini 代替作者来排,结论会和作者完全反过来。作者与三个 AI 评委的秩相关也弱:Gemini τ=0.14(与零不可区分),GPT 0.27,Claude 0.20。

为什么重要

对做 agent 编排的人,这篇是个直接提醒:在「给已成稿的研究论文写反馈」这件事上,堆更多智能体、烧更多 token 不等于更好,而且这里输掉的不是某个强 baseline,是最朴素的「读一遍就写」。落地时,简单单次直出应当作为默认起点,辩论式或多智能体流程要先证明自己真的赚回了那 35 倍成本再上。

对把 AI 当评委的人,这篇是更强的警告。AI 评委跟人类作者的偏好弱相关,还会系统性地把真人审稿垫底。在「AI 能不能替人做学术裁判」上,证据指向「现在还不行」。别拿一个模型的偏好去替作者做判断,Gemini 那个反转就是个现成反例。

局限与存疑

作者自己列了几条要害。一是把三份报告都压到约 1000 词,这可能天然偏袒单次直出,因为辩论工具平时的优势正在于更长更细的输出。二是只测了经济学元分析这一种体裁,而元分析恰恰是「结论可核对」的那类,辩论的价值可能更多在含糊、开放的问题上,这等于挑了辩论最没优势的场地来比。三是 paper-workshop 跑的是「轻量」配置,完整版没测。四是测的是作者「主观感知有用性」,不是论文按这些意见改完后真实变好了多少。

通读下来还有两点存疑。论文里各篇之间的评分一致性很弱(评委间成对秩相关平均 τ=0.049),说明这份排序本身噪声不小,0.66 个名次点的差距要稳妥解读。另外作者承认参与打分的人可能用了 AI 辅助排序,虽然与评委的低相关暗示他们大体是自己判断的,但这层不确定性没法完全排除。

术语

原文与代码

社区讨论

相关论文

全部论文解读