手工核查 105 篇论文:复现失败多因代码缺失和结果不一致

ChenhaoTan · x · 2026-07-23

手工核查 105 篇论文后,研究者发现不可复现多半不是“模型不够强”

作者表示,他们的分析显示,论文复现失败的主因往往不是模型能力本身,而是更现实的工程与发布问题。

文中给了一个具体例子:某论文声称方法只训练了基座模型 0.77% 的参数,这是它的主要卖点之一;但实际放出的 checkpoint 训练了 6.31%,大约是前者的 8 倍。那个 0.77% 只有在假设所用 adapter 只有已发布版本 1/8 大小时才说得通。

配图总结了他们在 105 篇论文里看到的常见不可复现原因:

结论是:105 篇里有 101 篇至少存在上述一项问题。作者想强调的不是模型能力,而是缺失工件、代码/论文不一致、报告口径混乱这些更基础的复现障碍。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →