研究警告「科学判断坍缩」:AI 审稿数据回流训练将压缩评分多样性

Sy-Tuyen Ho · hf · 2026-09-21

一项受控实验研究了 AI 同行评审的递归风险:当模型生成的审稿进入公开数据并回流到未来训练语料,后续审稿模型会从早期模型的判断中学习。

实验设置:从 Llama 3.1 8B 出发,先在 2018–2023 年 ICLR 官方审稿上微调审稿模型,再让四个后继模型在 ICLR 2024 数据上训练,其中官方与模型生成审稿的比例系统性变化。

发现:混入合成审稿会压缩评分分布,并降低同论文及语料级的语义多样性,作者称之为「科学判断坍缩」(scientific-judgment collapse)。

缓解方案:开源系统 TrustReviewer 从两端干预——训练时用精选语料做单阶段训练,减少低质与语义退化的监督;测试时用成对 activation steering,无需再训练或专家标注即可抑制坍缩倾向。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →