手工核查 105 篇论文:复现失败多因代码缺失和结果不一致
ChenhaoTan · x · 2026-07-23
手工核查 105 篇论文后,研究者发现不可复现多半不是“模型不够强”
作者表示,他们的分析显示,论文复现失败的主因往往不是模型能力本身,而是更现实的工程与发布问题。
文中给了一个具体例子:某论文声称方法只训练了基座模型 0.77% 的参数,这是它的主要卖点之一;但实际放出的 checkpoint 训练了 6.31%,大约是前者的 8 倍。那个 0.77% 只有在假设所用 adapter 只有已发布版本 1/8 大小时才说得通。
配图总结了他们在 105 篇论文里看到的常见不可复现原因:
- 代码按原样运行不了:58
- 数字与论文不一致:48
- 数据不可用:42
- 没有发布可运行代码:38
- 没有发布训练好的模型:18
- 代码与论文不匹配:15
- 依赖旧模型或不可用模型:4
结论是:105 篇里有 101 篇至少存在上述一项问题。作者想强调的不是模型能力,而是缺失工件、代码/论文不一致、报告口径混乱这些更基础的复现障碍。
「研究」频道最新
- 应用数学主导AI浪潮,为何梯度下降依然有效? — fkasummer · 2026-07-23
- Cursor 的 Composer 2.5 推理明显弱于 Kimi 基座模型 — gleech · 2026-07-23
- Lanyon 称其神经符号求解器快前沿模型 20 到 250 倍 — burny_tech · 2026-07-23
- Kimi K3 配合 Tinker 跑出 19 组自动研究实验 — burny_tech · 2026-07-23
- GPT-5.6 Pro 一条提示词后给出数学猜想证明 — scaling01 · 2026-07-23
- Reddit 称 SAOD 可把 744B 模型从 1.5TB 压到 100GB 以下 — pmttyji · 2026-07-23