SciSlopBench:AI 生成论文可 85.9% 识别,与 ICLR 评分负相关

SeoulNatlUniv · hf · 2026-10-05

首尔国立大学构建 SciSlopBench(390 篇 AI 生成论文,每篇配以同问题同贡献类型的人工论文),从结构、论证、产物三个维度六项指标刻画 AI 论文的「科学垃圾感」:每部分看着合理,但连接各部分的科学推理断裂。

发现

缓解:直接优化指标行不通(标准改写残留 slop,直接 slop 感知提示词触发 reward hacking)。提出 SciSlopHarness,让固定 LLM 仅在实验记录支持处修改,将 AI-人类差距缩小 63%,无需人工参考。结论:AI 生成论文在全局推理上留下根本痕迹,负责任的缓解需严格证据约束而非修辞润色。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →