AI 代理复现 ICML 2026 口头论文,只有 7 篇基本站得住
ChenhaoTan · x · 2026-07-23
这条转发围绕一项论文可复现性与 AI 审稿研究展开,核心问题是:学术科学到底有多少是可以被验证的?
作者用 AI agents 复现了 ICML 2026 的 oral papers,包括 105 篇完整复现,并给出几组很有冲击力的数据:
- 105 篇论文里,只有 27 篇 复现出了研究目标结论的 40% 以上。
- 只有 7 篇 复现效果超过 80%。
- 在两位及以上人类审稿人达成共识的评论中,78% 也被 AI 审稿覆盖。
- 在代码和可复现性问题上,AI 审稿指出了 903 个人类审稿没提到的问题;反过来,人类审稿只提出了 22 个 AI 漏掉的问题。
作者的结论是:
- AI 很适合补足代码、复现性和细节检查。
- 但在人类更擅长的新颖性判断、定位与品味上,AI 仍然落后。
这意味着,未来的科研评审可能不只是“读论文叙事”,而是逐步转向“用 agent 验证科学”。
所属事件:AI智能体复现ICML论文,168篇仅7篇经得起验证(5 条相关)→
「漫话AGI」频道最新
- 「把末日论者全赶出 AI 公司」,mark_k 引发安全派论战 — mark_k · 2026-09-11
- Adam Marblestone 播客书单:从智能演化到数字心智 — KordingLab · 2026-09-11
- David Patterson:反对 AI 与数据中心是蠢还是恶? — davidpattersonx · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 越狱频发引反思:模型训练该不该加入道德框架 — Pfungus_ · 2026-09-11
- 孙正义:人类是最高级生命形式的时代即将终结 — Puzzleheaded-King584 · 2026-09-11