研究警告「科学判断坍缩」:AI 审稿数据回流训练将压缩评分多样性
Sy-Tuyen Ho · hf · 2026-09-21
一项受控实验研究了 AI 同行评审的递归风险:当模型生成的审稿进入公开数据并回流到未来训练语料,后续审稿模型会从早期模型的判断中学习。
实验设置:从 Llama 3.1 8B 出发,先在 2018–2023 年 ICLR 官方审稿上微调审稿模型,再让四个后继模型在 ICLR 2024 数据上训练,其中官方与模型生成审稿的比例系统性变化。
发现:混入合成审稿会压缩评分分布,并降低同论文及语料级的语义多样性,作者称之为「科学判断坍缩」(scientific-judgment collapse)。
缓解方案:开源系统 TrustReviewer 从两端干预——训练时用精选语料做单阶段训练,减少低质与语义退化的监督;测试时用成对 activation steering,无需再训练或专家标注即可抑制坍缩倾向。
「漫话AGI」频道最新
- Claude 智能体 11 天写下 1300 万行 Lean,完成费马大定理机器验证证明 — liuzhuang1234 · 2026-09-21
- 评 EA 运动:一场缺乏质疑护栏的高能动性应用哲学实验 — jessi_cata · 2026-09-21
- Meta Muse 惠及日常还是接管人生?个人 Agent 权限边界引争论 — yi111 · 2026-09-21
- ctjlewis:当下无法阻止 AGI 出现,谈预防如同阻止日出 — ctjlewis · 2026-09-21
- Timothy B Lee:X-risk 圈对 RSI 与超级智能的用法近乎不通 — binarybits · 2026-09-21
- Understanding AI:驳 AI 生存风险的六条思考原则 — binarybits · 2026-09-21