AI 复现 ICML 168 篇口头论文,仅 7 篇完全经得起检验
profjamesevans · x · 2026-07-23
芝加哥大学 SAI Labs 团队利用 AI 智能体对顶会 ICML 的 168 篇口头论文进行了全面审查与复现,发现仅有 7 篇论文能够完全经得起验证。
研究团队指出,此举并非单纯为了证明同行评审在 AI 时代变难了,而是揭示了现有的同行评审机制从来都不是一个足够强大的“验证器”,无法支撑科学的累积性组装。自上而下的验证暴露了分布式科学的根本挑战。
研究主要探讨了三个核心问题:
- 复现成本:估算复现一篇顶级 ML 论文的中位数开销。
- 验证盲区:对比纯文本叙事评审,代码复现能揭示哪些被遗漏的问题。
- 评审对齐:评估 AI 审稿系统与现有纯人工评审的一致性。
目前该项目已开源全部验证代码与结果。
所属事件:AI智能体复现ICML论文,168篇仅7篇经得起验证(5 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27