合成评审只训一步,ICLR打分分布变窄,同篇语义多样性掉11%

When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation

Sy-Tuyen Ho, Minghui Liu, Furong Huang

cs.LG

2026-09-18

Llama 3.1 8B在ICLR官方评审上递归掺入合成文本后,评分更集中、同篇语义距离约降11%。TrustReviewer用过滤语料加激活引导,exact match达到75.40%。

这篇在解决什么

LLM 已经在写评审、改评审、打分。这些文本一旦公开,就会进下一轮训练语料,后来的评审模型会学到前代模型的判断。这是评审版的递归训练。生成数据上的 model collapse 文献提示过分布尾巴会被抹掉,但「科学判断会不会变窄」还缺受控证据。

马里兰大学只用一步递归、一个基座,把这个问题钉死:合成评审进训练集之后,打分是更松、更严,还是只是更同质。

方法

基座是 Llama 3.1 8B Instruct。先在 2018–2023 的 ICLR 官方评审上 LoRA 微调得到 M1,再用 M1 给 2024 年论文写合成评审。后继模型 M2 在每篇固定三份评审的混合物上继续训,合成占比取 0%、33%、66%、100%(对应 0/1/2/3 条合成),其余超参完全相同。论文写「官方」而不写「人类」,因为 ChatGPT 之后的官方评审里可能已经有未观测到的 AI 协助。

评测留出 2000 篇跨年论文,每篇三次独立生成。看评分均值、标准差、熵,以及同篇多评的语义两两距离和语料相对质心的散布。

缓解侧的 TrustReviewer 不再走递归。2018–2025 官方评审经过统一过滤,得到 112,743 条、约 19 亿 token,单阶段 SFT。推理时用 5000 对「官方评审 vs 模型评审」在最后一层估一个 steering 向量,强度 α=0.15,只加在当前 token 的残差上,不再训、不再标。

结果

对照是官方评审评分标准差 1.73、熵 2.38。M2 在 0% 合成时已是 1.63 和 2.31;33% 合成再压到 1.44 和 2.14,66% 与 100% 仍低于 0% 基线。均值不单调:0% 时 5.30,33% 升到 5.85,100% 回到 5.70。变窄的是多样性,不是系统性更松或更严。

同篇语义距离从 0.159 降到 0.142(约 11%),语料散布从 0.609 降到 0.579(约 5%),都随合成比例单调下降。

模型Exact MatchMAD评分熵
Llama 3.1 8B Instruct33.93%2.6791.53
Qwen3.6-35B-A3B61.85%1.3351.94
OpenReviewer73.10%1.1132.10
TrustReviewer 无 steering73.85%1.0772.13
TrustReviewer75.40%1.0792.18
官方评审(参考)2.38

Steering 把 exact match 再抬 1.55 个点,熵从 2.13 到 2.18,MAD 基本不动。同篇距离略降,仍高于通用 Llama/Qwen,低于 OpenReviewer。OpenReviewer 的训练语料不公开;这篇把过滤后的语料放出来了。

为什么重要

如果会议继续把模型写的评审喂回下一届模型,一步递归就够把打分分布压窄、把同篇意见拉齐。这不是「AI 评审更毒或更水」,是判断空间在收缩。对策也很具体:训练时把短、重复、结构坏的监督滤掉,推理时用官方与模型评审的激活差做一次轻推。做自动审稿或审稿助手的人,至少不该在未过滤的合成评审上继续 SFT。

Exact match 对齐的是官方分数分布,不是科学对错。多样性高也不等于评审更好。

局限与存疑

附录写得很清楚:实验只有一步递归、一个 8B 家族、一个 ICLR 审稿域,多代会不会叠加、换模型或换学科会不会一样,都没测。多样不等于质量,同质集合也可以全对。Exact match 和 MAD 量的是跟官方分数的吻合,官方评审本身有错、有分歧、也可能含 AI。嵌入距离是特定嵌入模型上的代理,不能直接等于「提出了不同的有效科学问题」。没有人类对批评正确性、具体性和覆盖面的评估。M1 的训练截止对齐 Llama 3.1 的 2023 年 12 月数据截止,用来降低 2024 评审进预训练的风险,但不能排除。

术语

原文与代码

相关论文

全部论文解读