Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents
Jingjie Ning, Shanshan Zhong, Xiaochuan Li, Ji Zeng
cs.MA, cs.AI, cs.SE
2026-09-07
CMU提出DCP,把AI科研结果拆成密封增益、无历史回收、反馈效应三道门。SQLite与催化剂两项审计各96次零回收(上界0.0468),诚实反馈30/30、中性0/30。
AI科研智能体已经能交程序、配方、实验方案,并报出一个分数。问题是这个分数从哪来。智能体可能跑了87次实验才摸到分数x,也可能只是把公开文档、初始数据和自身先验重新组合了一遍。密封测试能证明产物有用,证明不了这条路径不可替代。
卡内基梅隆大学这篇把「发现」拆成三件可执行的事:产物在密封评测上是否真的比基线好;匹配智能体拿到同样的起始信息和已见网页、但拿不到目标运行历史时,能不能回收同一分数;从某个检查点开始,诚实反馈相对中性通道是否真的提高了到达目标的概率。分数只是起点。
协议叫 Discovery Certification Protocol(DCP)。审计围绕五个对象:运行前固定的背景K(模型、任务规则、起始代码、工具)、与动作无关的初始观测E0、目标运行产生并被后续动作消费的研究历史L、按预注册规则选出的最终产物A、以及机器可执行的回收谓词P。
三道门分开问三件事。
Gate 1 看效用。在密封评测上,A相对基线的效用下界至少达到预注册的最小有用增益δmin,产物合法,且基线分数落在回收区之下。
Gate 2 看回收。给一批新鲜匹配智能体同一套K、完整E0、模型和工具预算,以及目标运行实际见过的网页字节Wobs,但扣掉L。任何合法产物分数达到x−ε,就算一次合格回收,Core当场否决。没有回收时,用n次独立回合的零命中给出回收概率pB的有限样本上界,要求pupper≤ρ,且正对照、机会预算、信息包全部合格。回收规则认所有合法方法:换实现、跨域搬组件、重新组合已知模块,只要分数到线就算。
Gate 3 可选,看反馈。从预注册检查点c分出成对分支,一边给诚实测量,一边给保持时序和长度、但不指向正确答案的中性消息。证据门还要求空任务上中性通道落在±δsham等价带内,且效应下界超过δevidence+δsham。
判定分两档。DCP Core = Gate 1通过 + 对照合格 + 零回收 + 上界达标。DCP Evidence = Core再加上通过空校准的反馈效应。对照弱、接口坏、注册失败,记成 audit incomplete。一份确定性、不用LLM的校验器从冻结证据包重放全部判定。
两套完整三门审计,模型不同、任务不同,判定一致。
| 任务 | 模型 | 主结果 / 基线 | 回收线 | Gate 2 | 判定 |
| SQLite事件服务 | DeepSeek-v4-flash | 0.8855 / 0 | 0.8805 | 0/96,最好0.6734 | Core+Evidence |
| 虚拟催化剂 | DeepSeek-v4-pro | 1.0000 / 0.5990 | 0.9500 | 0/96,最好0.8146 | Core+Evidence |
| 设备校准 | Flash | 1.0000 / 0.3667 | 0.9500 | 0/80,最好0.7133 | Core |
| 多维背包 | Flash | 0.9349 / 0.9140 | 0.9329 | 同回合回收到0.9363 | 被回收否决 |
SQLite任务要在16类查询里选4个部分索引,真实高流量只有4类,分数是流量加权虚拟机步数相对无二级索引的削减。目标运行先读了两页 sqlite.org 文档,密封评测上相对无索引基线砍掉88.55%的VM工作,挑战者最高0.6734。催化剂任务有5个控制、各8档,共32768种配方;智能体先交锚点,拿到36孔单因素板,再交最终配方,密封256条件下打到1.0,挑战者最高0.8146。
两套审计都是0/96回收,pupper=0.0468,低于注册的ρ=0.05;正对照45/45,召回下界0.8889,高于0.8。Gate 3各30对:诚实臂30/30回收,中性臂0/30,配对二元99%区间[0.6379, 1.0];另60对空任务差为0,区间[-0.0950, 0.0950],落在±0.17带内。校验器两套都给Evidence。
背包案例专门打回收门:目标相对基线只涨约0.021,一次匹配回合里两个合法解都越过0.9329。SQLite完整流507次会话、61.17美元;催化剂435次、56.40美元,判定可离线重放。
评测榜单问的是智能体能不能把分数做上去。DCP问的是三件更难的事:分数有没有密封增益、别人拿同一起点能不能抄到、反馈通道是不是在干活。对写 AI Scientist 类系统的人,这是一份可提交、可挑战、可复放的证据语言:产物哈希、信息边界、回合预算、回收上界、反馈区间。评审不必信作者叙事,跑校验器即可。
它是测量学工具,不是新的搜索算法。任务是可控的软件优化和虚拟实验。正式发证还要独立来源核验和注册会签,论文里的 bundle 全部 issued=false。
审计任务是信息边界已知的受控环境。SQLite的高流量家族和催化剂的最优档位是藏好的,用来证明协议能分出Core、回收、incomplete,不能外推到开放科学发现。
Gate 2的挑战者拿不到新的任务分数和科学测量,只给非定向消息。这测的是无实验历史时能不能回收,不是第二个智能体自己做完整研究会不会独立发现。96次零命中的上界仍是0.0468,不是0。Gate 3的中性回收上界在30回合时还有0.1619,平均反馈收益和中性回收被拆开报告。
两套完整审计都用 DeepSeek-v4 系列,Claude CLI 只当执行层。换模型、换预算,回收概率要重新注册。网页访问按字节回放已见页面,不是开放搜索。历史优先权记成 not assessed。