2026-08-24
杜元琦等主张用发现回合评测 AI 科学家:记录假设、执行与解释的整条轨迹,保留失败并区分重发现。摘要未给新实验数字。
科学能力正在被做成考题。GPQA、Humanity's Last Exam 这类基准问的是:模型能不能答对一道很难、但有标准答案的科学题。分数在涨,发现并没有按同样的节奏出现。
发现靠的是一串不确定下的决策:把假设做成可检验的,把计算或实验跑可靠,再对噪声、失败和空结果做出有分寸的解释。答对难题只覆盖了其中一块。微软研究院 New England 的杜元琦、斯坦福的 Ludwig Schmidt 与 Steven Dillmann、Edison Scientific 的 Andrew White 与 Jon Laurent、Allen Institute for AI 的 Peter Jansen、Deep Principle 的段晨如与贾皓钧、伯克利的 Kristin Persson 在 ChemRxiv 发了一篇 Perspective,把这个错位写成评测问题:现有基准能测会不会答题,测不出能不能把科学往前推。
本篇只依据摘要和题录。ChemRxiv 全文被站点防护挡住,正文里的案例、图表和操作细则未能核对,不在下面补写。
评测单位从孤立问题换成 discovery episode(发现回合)。一个回合要记下科学状态如何变化、采取了哪些动作、观察到什么、假设如何修订,以及复现和审计所需的 provenance(溯源记录)。
能力被拆成三条互相耦合的线。
评测口径跟着改。给轨迹打分,不只给终点打分。失败和零结果要留下来,不能只展示成功路径。还要把真正的发现和训练语料里的 rediscovery(重发现)分开。
这样切是因为同一终点可以由回忆论文、过拟合或碰巧撞上。轨迹和溯源才能把这几件事拆开。发现的证据在过程里,不在最后那句答案里。
这是立场文章,摘要未给出新实验数字,也没有与 GPQA 或其他科学基准的对照表。产出是一套评测框架,不是一份排行榜。
正文若包含对现有科学 agent 基准的逐项批评、回合如何切片、轨迹分如何加总,本篇未能取到,不转述。
做 AI scientist 系统或评测的人,现在最容易做的事是继续加更难的考题。考题可以饱和,发现不会按刷分的节奏出现。这篇把目标函数改了:记录状态-动作-观察-修订,允许失败进入分数,并处理「模型其实在回忆已有论文」。
可执行的最小改动很具体。新基准至少要能存回合日志;排行榜不能只报最终答案正确率;数据污染要从「这道题见过没」扩成「这个发现是不是训练集里的旧结果」。署名跨实验室闭环和 agent 评测两边,说明两边都认这个方向。
它仍是规范工作,没有发布可跑的题目集,不能拿来直接打分。价值在改评什么,不在给出现成名次。
摘要把范围收在「应当如何评」,没有回答「怎么评才算数」。回合如何起止、轨迹分怎么合成、重发现用什么检测器,摘要都没给。缺这些,框架容易停在口号。
全文未取到,正文是否已经写了操作化定义或案例,无法核实。Perspective 也没有新数据支撑「按回合评测会改变模型研发优先级」这一隐含主张。
把发现做成可打分的回合,还可能把开放探索压成短闭环模板。摘要强调保留失败,但没说如何避免「为了可审计只做容易记账的实验」。