手工核查 105 篇论文:复现失败多因代码缺失和结果不一致
ChenhaoTan · x · 2026-07-23
手工核查 105 篇论文后,研究者发现不可复现多半不是“模型不够强”
作者表示,他们的分析显示,论文复现失败的主因往往不是模型能力本身,而是更现实的工程与发布问题。
文中给了一个具体例子:某论文声称方法只训练了基座模型 0.77% 的参数,这是它的主要卖点之一;但实际放出的 checkpoint 训练了 6.31%,大约是前者的 8 倍。那个 0.77% 只有在假设所用 adapter 只有已发布版本 1/8 大小时才说得通。
配图总结了他们在 105 篇论文里看到的常见不可复现原因:
- 代码按原样运行不了:58
- 数字与论文不一致:48
- 数据不可用:42
- 没有发布可运行代码:38
- 没有发布训练好的模型:18
- 代码与论文不匹配:15
- 依赖旧模型或不可用模型:4
结论是:105 篇里有 101 篇至少存在上述一项问题。作者想强调的不是模型能力,而是缺失工件、代码/论文不一致、报告口径混乱这些更基础的复现障碍。
所属事件:AI助力学术复现:研究称论文不可复现多因工程缺失(4 条相关)→
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11