AI 复现 ICML 论文:超六成失败,99% 论文有错
量子位 · wechat · 2026-08-09
近期多项研究显示,AI Agent 正被用于大规模审查和复现顶会论文,结果暴露了严重的学术可复现性危机。
- 复现极难:审计公司对 ICML 2026 的 168 篇论文进行测试,其中 92 篇有可验证声明,但仅 34 篇能被 AI 成功复现超 40% 的结论,能复现 80% 以上的仅 8 篇。失败原因多为代码缺失、依赖断裂甚至模型下线。
- 错误频发:基于 GPT-5 的检查系统发现,99.2% 的顶会论文至少存在一个客观错误(如数学公式错误),且近年来论文的篇均错误数呈显著上升趋势。
- AI 重审科学史:AI 不仅能挑错,还能发现百年前被奉为权威的化学数据错误。这表明人类首次具备大规模重审过往文献的能力,未来论文发表或将进入“AI 验证”循环。
「研究」频道最新
- 哈佛论文提出生成模型第三扩展轴:探索式训练省 4 倍算力 — rohanpaul_ai · 2026-08-09
- 实测15种语言: F2LLM与Zerank 2登顶本地RAG检索方案 — seamonn · 2026-08-09
- SIGGRAPH Asia 2024:TriHuman 实时高保真数字人渲染新架构 — chrisgrayson · 2026-08-09
- UIUC 与 CMU 推出 LUCID:让机器人看人类视频学操作 — lukas_m_ziegler · 2026-08-09
- 研究测试AI反欺骗对齐:OpenAI o3隐蔽违规率降至0.4% — gleech · 2026-08-09
- 微软披露1350万次Copilot会话:Agent调度不能照搬Chat — rohanpaul_ai · 2026-08-09