IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan, Arman Cohan
cs.CL
2026-09-10
Yale的IdeaAmbig用660条规格缺口评测:最强模型在真实缺口上定位成功率9.6%,给出口径后澄清成功率80.6%;补上缺失信息后可编码率从14%升到98%。
研究 Agent 已经把「想题目」和「写代码」接在一起了。中间那一截方法说明往往没人查:想法可以新颖、自洽、科学上看着像样,核心机制仍可能缺一步,两个能干的实现者会做出两种不同的方法。现有评测盯的是想法好不好,或论文和代码最终一不一致,默认方法已经被写清楚。缺口会变成静默的错误实现,复现失败看起来像执行问题。
Yale 把这个问题收成 codification readiness:一份面向实现的方法说明,够不够让胜任的实现者或编码 Agent 在不对核心方法做无依据假设的前提下,搭出意图中的初版。随机种子、硬件路径、常规 batch size 不必写死。挡住实现的是那个会改变方法本身的未决选择。
IdeaAmbig 有 660 条有证据支撑、单缺陷的实例。163 条来自 ML Reproducibility Challenge、ECIR、TMLR 复现报告和论文关联仓库的 GitHub issue,缺口和解决办法都能在源材料里对上。497 条是往已经复现成功的参考说明里精确注入一条实现关键改动。一级标签三种:歧义、不完整、不一致;下面再分十个二级类。真实缺口以歧义、尤其是含糊步骤为主,合成缺口以省略步骤为主。
三个任务拆开测:
评了 13 个模型。语义评判用 Claude Opus 4.8,并用人标注校准。
最强的 GPT-5.6-Sol 在真实子集上:就绪 Macro-F1 67.5,缺陷定位 Macro DRR 只有 9.6%,给出口径后的澄清成功率 80.6%。合成子集更容易:86.4 / 12.2 / 96.2。它会放行 31% 的未写清说明,也会误杀 34% 已经就绪的说明。理由接地分数最高也只有 0.36(真实)和 0.49(合成)。
定位是瓶颈。真实集上一级准确率 60.1、二级 25.2,真正找回那条 blocker 的 Loc-Acc 是 16.0。去掉分类标签只问是不是同一个 blocker,50 条样本上从 10% 升到 40%,分类在加难,但找到那条决策本身仍然难。粗粒度「整个模块没写」比「模块写了但局部含糊」好找。13 个模型同一趋势:一旦指向缺陷,澄清比发现缺陷容易得多。
同一模型、同一真实 Task 3:不给缺陷做端到端澄清,Macro-CAS 13.6;给了缺陷是 80.6。Oracle 研究里,把金标准补丁喂回去,下游可编码率从 14% 升到 98%。20 条带参考实现的合成例子上,预定义测试全过从 45% 升到 85%,目标方法细节被忠实实现从 30% 升到 90%。测试能过,方法仍可能被换成另一个。
自动科研流水线缺的是实现前的规格门,不是又一个「想法打分」。模型已经会在你指出缺口时把该问的问题问出来,但很少能自己从一份看起来完整的方法描述里把那个会改方法的选择揪出来。把定位做成强制门、过了再允许写代码,比事后对论文和仓库,更能挡住静默的方法漂移。对要靠 Agent 复现或扩展论文的人,这篇给出的是可测的失败模式,不是又一套生成器。
实例是回顾性重建,不是当时交接记录,模型也看不到下游仓库。单缺陷是诊断用的受控抽象;50 对合成样本的多缺陷消融没有显示定位更难,但样本量小、回复条数不对齐。澄清只评一步,Oracle 效用研究直接给了金标准答案,量的是澄清成功的上限,不是端到端 Agent。数据偏 AI / NLP / 机器学习。可执行验证只有 20 条。Task 1 的就绪样本是 100 正 100 负的平衡集,不是自然比例。