2026-08-24
Gomes组这篇Nature评论认为,自主实验的信任来自可回看、可审计、可改判的全程记录;只打开模型或封存一份不能改的日志,都接不上科学信任。
大模型已经开始自己规划实验、调度仪器、给出成败裁决。同一组人 2023 年在 Nature 上演示过 Coscientist:一句自然语言指令,就能让模型在自动化实验室里规划并完成化学反应。社区的第一反应通常是,模型内部看不透,就不能信它产出的科学结论。
卡内基梅隆大学 Gomes 组(MacKnight、Novitskiy、Radadiya、Gomes)在 Nature Computational Science 发了一篇 Comment,把这个反射拧过来。科学信任从来不靠看见科学家脑子里在转什么,靠的是一份能被重新打开、拿去审计、发现错了还能改判的记录。可解释性仍然有用,但入口是记录。
四页正文在付费墙后。下面的机制复述来自公开摘要、Fig. 1 和参考文献列表,不是对原文的逐段转写。没在这三处出现的字段规范和案例展开,这里不补。
这是立场评论,没有新模型,也没有新 benchmark。论证被压进一张四联图。
Fig. 1a 把三件事拆开。Autonomy 是能动手,画成机械臂;Interpretability 是或许能解释,画成放大镜对着一张网络图;Record 是能重建、能审计、能改判,画成一份被划掉的裁决书。前两根线接不到「科学信任」上,只有记录接得上。会跑反应,和能看模型,都还差一步。
Fig. 1b 把一次实验拉成流水线:输入 → 模型 → 动手 → 测量 → 裁决。可解释性的括号只罩住中间那个模型盒子。下游测量和裁决才是出错高发区,图上标了 Downstream error。要挡住这类错,溯源记录得横跨整条链:prompt、模型与工具、实验计划、试剂信息、原始数据、最终裁决。原始数据必须留下。裁决错了,沿着这条链把 verdict 重新打开。
Fig. 1c 专门打「日志很全」这个幻觉。左边是 Sealed log:每次 run 都记成 PASS,锁上,完整,但不能回看。错判就永远停在 PASS。右边是 Re-openable record:同样完整,但 Run 0512 可以从 PASS 改成 FAIL,因为原始数据还在。完整不等于可纠正。封存式日志在科学上几乎等于没记。
Fig. 1d 给出操作约束。图上的示意刻度是:已验证且已记录大约每天 100 次,执行能力大约每天 1000 次。可信运行速率被「验证 + 记录」卡住,多出来那截画成斜线,标成 Unvalidated excess,未审计风险。自主实验室如果按机械臂吞吐拉满、记录跟不上,多跑出来的不是科学,是无人核对的噪声。
参考文献把这条论证钉在化学史和机器学习史上。Leadbeater、Arvela、Buchwald 那组钯污染文献说明:人写的「成功反应」也可以是试剂里微量钯在干活,方法本身是空的。Rudin 2019 代表「高风险场景别解释黑箱、直接用可解释模型」的立场;McCloskey 2019 则演示过,分子模型的归因解释会抓住虚假特征。两条并在一起读,可解释性既不是充分条件,也不总可靠。Wilkinson 的 FAIR 原则和欧盟 AI Act 的记录义务,是这篇把 provenance 抬成信任入口时借用的制度语言。Sutton 的 Bitter Lesson 被引在这里,意思接近:别把宝押在手写的可解释结构上。
没有新实验,没有对照表。唯一带数字的是 Fig. 1d 的示意吞吐:验证记录约 100/天,执行约 1000/天。正文未取到,无法核对这两档是不是某个实验室的实测,按示意图理解更稳妥。
能核对的硬信息只有这些:体裁是 Comment,4 页(804–807),2026 年 8 月 20 日在线;机构是卡内基梅隆化工、化学、机器学习系;经费来自 NSF Center for Computer-Assisted Synthesis(编号 2202693)和 GSK 的博后支持。
给正在把大模型接进实验室的人,这篇改的是验收标准。系统日志如果只能证明「当时报了 PASS」,不能让人拿原始谱图把 PASS 改成 FAIL,那份日志对科学信任没有贡献。可解释性工具仍然值得做,但它覆盖的是模型,覆盖不了试剂批次、传感器漂移和裁决规则。
更具体的工程含义:瓶颈从「一天能跑多少反应」挪到「一天能验证并写完多少可回看记录」。按图上大约 10 倍的缺口,记录子系统才是产能上限。自主性如果被用来批量生产无法改判的结论,会把文献里已有的偏差放大,纠正不了。
摘要里那句「让自主性成为文献偏见的纠正器,而不是对严谨性的威胁」,前提就是记录可回看。做不到这一点,agent 实验室只是一台更快的发论文机器。
付费墙挡住了四页正文。摘要和图把论点讲清楚了,支撑性案例怎么展开、有没有给出 provenance 的字段规范或接口,这里核对不了。不要把这篇 Comment 当成已经可落地的协议。
图上 100 对 1000 没有误差条、没有数据来源。拿它当产能公式会过度解读。
作者利益冲突写得很清楚:MacKnight 和 Gomes 是 evals 咨询公司联合创始人,目前还挂职 X, The Moonshot Factory(原 Google X)。评论在为「记录优先」做规范主张,主张本身和他们的商业、雇主方向是对齐的。读者自行打折。
这篇也没有回答一个硬问题:谁来做那个「验证 + 记录」的每天约 100 次,人还是另一个模型。如果验证者还是模型,溯源链只是往上叠了一层同样需要被记录的东西。