AutoSciRub先写可执行量表,科研agent平均再涨2到17分

Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents

Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang, Yijun Chen, Zirui Xue, Shumin Deng

cs.CL, cs.AI, cs.IR, cs.LG, cs.MA, cs.SE

2026-09-01

浙大等让科研agent先诱导可执行量表再执行和返工:四十题平均加两到三分,AstaBench二十题平均加十六点八分,有量表的修订增益约2.7倍。

这篇在解决什么

科研 agent 已经能把文献、实验、代码和报告串成一条流水线,但任务指令通常只给一个高层目标。该做哪些分析、用什么方法、怎样才算证据充分,往往写在纸面之外。结果是报告看起来完整,关键实验却漏了,方法不对,结论也站不住。

现有科研基准里的量表多半是事后打分工具,还经常要专家手写,难扩到新任务。自动生成量表的工作又容易漂:不问文献惯例、不看手头数据,写出的条目会不可执行或科学上没根据。缺口很具体:量表应在动手前把隐含要求写成可执行规格,再拿它指导实验、逐条核验和定向返工。

方法

AutoSciRub 分两段。第一段是自动量表诱导。指令先被拆成一组原子科学目标,这一步只写「要回答什么」,不写具体方法和预期数字。每个目标再去文献和网页里找惯用方法、指标、对照和稳健性检查,检索会避开任务标识和隐藏目标论文。接着做一次轻量数据探查,看哪些分析在当前文件、字段和标签下做得到。最后把目标、文献惯例和数据条件合成可执行条目:每条绑数据源、实验、指标、对照、产物和通过条件。

第二段把这份量表交给骨干科研 agent。先按条目做实验和写初稿,再逐条核验:满足或缺口写清楚。未通过的条目变成定向修改指令,补实验、改图表或删掉没证据的句子。预算用尽或全部通过就停。它是插件层,不换底层模型和工具。

结果

在 ResearchClawBench 的 40 个跨十学科任务上,固定 Codex 套件时,GPT-5.4、GLM-5.2、MiniMax-M3 分别从 18.66、20.86、19.05 升到 21.04、22.73、21.04,平均加 2.08 分。固定 DeepSeek-V4-Flash 换套件时,Claude Code、OpenClaw、OpenScience 分别加 2.14、3.11、3.60 分。60 组领域对照里 49 组上升。绝对分仍低:基准把约 50 分标成接近目标论文重现,最好配置也只有 22.73。

AstaBench End-to-End Discovery 抽了 Easy 集 20 题,三个套件平均加 16.8 分;Claude Code 和 Codex 的完成数从 18/20 到 20/20。消融(OpenClaw + DeepSeek-V4-Flash)里,骨架 +0.36,接地量表到 18.31(+1.06),加上迭代修订到 20.36(+3.11)。无量表的自我改写三轮只到 19.08,中途还回退过;有量表的修订单调升到 20.36,约 2.7 倍增益。四十题里 35 题三轮内通过核验。

量表质量上,骨架到可执行稿的四维均分从 2.20 到 3.84,特异性从 1.65 到 4.40。科学核心覆盖却从 3.35 降到 3.07:它更会把已选方向写细,不大会改掉一开始就偏的问题框架。

为什么重要

对做科研 agent 的人,这是一条可插的控制回路:先把「怎样算做完」写清楚,再让模型去跑。增益在不同模型和套件上重复出现,说明瓶颈经常在规格,不在再换一个更强的骨干。AstaBench 上的跳升也说明,当任务更接近开放发现时,缺规格的代价更大。

增益是渐进的,而且 ResearchClawBench 上离「重现目标论文」还很远。把它当成生产科研系统还早,更像给现有 agent 加一层执行时验收。

局限与存疑

论文没有单独的局限节,正文自己已经露出几处软肋。科学核心覆盖略降,说明接地和综合可能把次要分析写得很细,却修不了骨架阶段选错的方向。领域分数并不全涨,信息科学、材料、数学在部分配置上会掉。ResearchClawBench 的绝对分仍在 20 附近,相对「约 50 分≈目标论文」很远。AstaBench 只随机抽了 Easy 的 20 题。打分都靠 LLM(报告用 GPT-5.1,AstaBench 用 MiniMax-M3),诱导出的量表和隐藏专家清单是否同义,仍然隔着一层模型判断。修订会加推理轮次,论文没有给出墙钟或美元成本。

术语

原文与代码

相关论文

全部论文解读