SciSlopBench:AI 生成论文可 85.9% 识别,与 ICLR 评分负相关
SeoulNatlUniv · hf · 2026-10-05
首尔国立大学构建 SciSlopBench(390 篇 AI 生成论文,每篇配以同问题同贡献类型的人工论文),从结构、论证、产物三个维度六项指标刻画 AI 论文的「科学垃圾感」:每部分看着合理,但连接各部分的科学推理断裂。
发现
- 识别 AI 论文准确率 85.9%,远超 token 级检测器 Binoculars 的 68.7%;
- slop 程度越高 ICLR 评分越低,2017–2025 每一年都能以高于随机的水平区分拒稿与录用论文;
缓解:直接优化指标行不通(标准改写残留 slop,直接 slop 感知提示词触发 reward hacking)。提出 SciSlopHarness,让固定 LLM 仅在实验记录支持处修改,将 AI-人类差距缩小 63%,无需人工参考。结论:AI 生成论文在全局推理上留下根本痕迹,负责任的缓解需严格证据约束而非修辞润色。
「安全」频道最新
- 谷歌 AI 疑似「知道」用户没说过的猫名,引发隐私疑虑 — Rare_Bat2584 · 2026-10-05
- 安全研究员演示从 SQL 查询劫持 SSMS 内置 Copilot 直取 SYSADMIN 权限 — wunderwuzzi23 · 2026-10-05
- Agent 上生产环境前必答五问:MCP 工具接入的实战检查清单 — ainexfinder · 2026-10-05
- Hinton 再提 AI 安全:家长管婴儿类比,关键词是怜悯而非共情 — petitegeek · 2026-10-05
- Meta 的 AI Agent 各存各的记忆,用户 CCPA 数据请求怎么执行? — dbreunig · 2026-10-05
- 9 个前沿模型 7 个会暗中泄露密钥,论文揭示「暗中协助」风险 — illinois · 2026-10-05