ICML 2026 口头论文复现分数重算后仍偏中等
profjamesevans · x · 2026-07-27
这条转发的是一篇关于 ICML 2026 oral papers 可复现性 的更新分析。作者修订了评分规则:把每条 claim 分成三类——AI agent 根本没尝试、尝试过且能跑起来、以及完全在原始范围内跑通——再重新计算复现分数。
图表给出的关键信息包括:
- 168 篇 oral papers 被接收,其中 104 篇提供了可运行代码;
- 105 篇被作者团队完全复现;
- 其中 92 篇至少有 5 条可验证 claim,因此进入主分析;
- 在这 92 篇里,只有 34 篇复现了超过 40% 的 claim,只有 8 篇超过 80%。
作者还比较了两种口径:
- 更宽松的 verifiable claims 口径下,中位复现率大约是 28%;
- 更严格的 fully in scope 口径下,中位数会升到约 42%(在至少 3 条可判断 claim 的条件下)。
整体结论是:即便换不同阈值,复现表现依然不算理想,而且样本较小的论文对评分口径非常敏感。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27