改写证据框架和新颖表态,AI 审稿分数最多跳 0.93 分

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou

cs.CL, cs.AI

2026-08-10

改写 4200 份 ICLR 论文验证:只调整措辞不改科学内容,AI 审稿人打分最多变动 0.93 分,证据框架与新颖性表态最容易被“忽悠”。

这篇在解决什么

AI 审稿正在越来越多地介入论文评审,一部分平台已经在用 LLM 生成初步意见,分担人类审稿人的压力。同一批研究者同时也在用 LLM 帮作者润色稿件。两件事叠在一起,审稿分数到底是被科学内容决定,还是被写作腔调决定,就成了一个真实问题。此前有零星证据显示,只改措辞、不改数据的“包装”能让 AI 审稿打分上升,但没人系统拆过:到底是哪种措辞在起作用,效果稳不稳定。这篇论文(University of Maryland、Virginia Tech、MBZUAI 等)用一套受控实验把这个问题量化了下来。

方法

团队从 120 篇匿名化的 ICLR 2026 投稿出发,构建了 4,200 份完整论文稿件的语料库。核心设计是把修辞呈现和科学内容拆开:用 GPT-5.5(经 Codex CLI)和 Opus 4.8(经 Claude Code)两个改写 agent,分别对每篇论文的 6 个修辞维度做正反两个方向的改写,包括新颖性表态、范围界定、证据框架、贡献显著性、技术措辞、词汇句法复杂度。改写会动全篇的正文、图表标题、结果呈现,但受“软约束”限制,方法、实验设置、数字结论必须保持不变;程序化检查器另外核对引用键、公式环境、代码块等结构锚点没被破坏。改写完的稿件交给 5 个 AI 审稿模型(Gemini 3.5 Flash-Lite、Qwen 3.5 Flash、GPT-5 mini、GPT-5.5、Claude Sonnet 5)在标准和严格两种审稿协议下打分,再和同一篇论文的原始版本做配对比较。除了单维度改写,还测了联合改写、递归改写、审稿反馈引导的改写。整套实验跑出 42,396 条有效审稿记录,API 花费 29,165.89 美元。

结果

6 个维度里,证据框架和新颖性表态的影响最大且最稳定,范围界定排第二档,其余三个维度效果小且不稳定。正向的证据框架最多能把总评(OA)拉高 0.93 分,负向的新颖性表态最多能拉低 0.73 分;证据框架平均能让“弱接收”概率变化 13 个百分点。这个排序在人类评分不同档位的论文里基本一致,但分数往哪个方向动,主要取决于 AI 审稿人自己给的初始分:初始打 13 分的论文,正向证据改写平均能拉高 1.05 分;初始打 810 分的论文反而平均掉 0.19 分。

联合改写(六个维度同时往正向改)不是简单叠加就更强:Opus 4.8 的联合改写在标准协议下平均拉高 0.289 分、严格协议下 0.463 分,但换成 GPT-5.5 做联合改写,标准协议下只有 0.021 分,几乎没用。审稿反馈引导的二次改写也没能稳定超过一次不带反馈的重写,改写轮数越多、边际收益越小。

改写模型主要决定正向变体和负向变体能拉开多大差距,审稿模型主要决定这个差距最终换算成多大、朝哪个方向的分数变化,同样的改写,Qwen 3.5 Flash 和 GPT-5 mini 反应幅度最大,GPT-5.5 最稳,Sonnet 5 的分数变化方向经常和其他模型相反。严格审稿协议会把平均总评从 6.296 拉到 4.934,95% 的论文打分下降,但论文之间的相对排名基本没变(Spearman 相关 0.862);对修辞的敏感度本身,严格协议并没有系统性地放大或缩小。

为什么重要

如果审稿流程里同时有 AI 帮作者改稿、AI 帮会议打分,这篇的结果说明修辞不是无害的润色,证据框架和新颖性表态的改写能在不碰任何实验数字的情况下,把一篇论文从弱拒推到弱收附近。对已经或正在试点 AI 辅助审稿的会议,这意味着光看单个模型的平均打分不够,得测它对修辞变化的鲁棒性,而且换一个审稿模型、换一条协议,结果可能完全不一样。对用 AI 润色投稿的作者,这也是把双刃剑:能诱导分数的改写方式同样可能被会议方拿来做反作弊筛查。

局限与存疑

论文自己承认几点:语料只来自 ICLR 2026 一个会议,能否推广到其他会议或学科不确定;全篇改写加多模型评审成本很高,部分计划内的审稿没跑出有效结构化结果,这种缺失可能不是随机的,某些论文话题触发了模型的安全限制,导致改写或审稿失败;六个修辞维度彼此并不正交,一次改写是对全篇的整体干预,不能把效果简单拆成某个语言特征的独立系数;多数实验条件下每篇稿件只跑一次 AI 审稿,复现审稿的稳定性只在附属审计里测过。另外,论文用的是 5 个特定 LLM 在特定 prompt 下的行为,不代表真实人类审稿人或所有可能的模型采样都会有同样的敏感度。

术语

原文与代码

相关论文

全部论文解读