Training AI Scientists to Replicate Research
Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes
cs.LG, cs.AI
2026-08-13
Inherent Labs 用 310 个论文复现任务加 rubric 判分器后训练 Qwen3.6-27B,测试集平均超 Claude Opus 4.8 6%、超 GPT-5.5 8%。
复现论文是科学自我检验的土办法,也恰好是训练 AI 科学家的好任务:它天然欠定(论文是有损压缩,细节没写全)、需要假设驱动的探索、没有确定的奖励信号可供现有 agent 框架爬坡,前沿 agent 在这类任务上明显吃力。Inherent Labs 把「复现一张结果图」做成可规模化的训练任务,并用它后训练出一个 27B 的科学家 agent。
三件套:
| 对比 | 结果 |
| 分布内 ML 测试任务胜过 Claude Opus 4.8 | 73% |
| 分布外 AI-for-science 任务胜过两个基线 | 60% |
| 测试集平均分相对 Claude Opus 4.8 | +6% |
| 测试集平均分相对 GPT-5.5(Codex) | +8% |
对 Codex 做了 24 轮自动提示词优化,差距没有实质性缩小。人类专家在 41 组对比中 29 组更偏好 Faraday。定性差异更能说明问题:基线模型常把预期输出硬编码或用过度简化的方法糊弄,Faraday 会实现被检验的机制本身。Darwin-Gödel Machine 一题,基线硬编码了搜索出来的 agent,Faraday 实现了演化搜索本身;GNoME 一题,基线每个点只跑单种子,Faraday 报了跨种子的不确定度。所有 agent 在越新的论文上表现越差,NLP 与 LLM 论文最难,经典 ML 最容易。
这是「后训练教品味」路线的一个扎实数据点:通用小模型加上任务对齐的后训练,能在欠定科研任务上超过别家的前沿模型。rubric 判分器、多采样平均、逐轮信用分配这套配方,可以迁移到任何奖励不可验证的长程 agent 任务。310 个任务连同自动生成管线如果开放,会是 SWE-bench 量级的社区资产。
作者自认处于早期:失败案例不少,judge 从未在「创新」类任务上验证过;人类偏好研究只覆盖判分器认定 Faraday 占优的 rollout,作者明说这推不出人类平均更偏好 Faraday;训练只覆盖 60 分钟、七分之一 GPU 的短程任务,全尺度复现未验证。测试集只有 68 个任务,+6% 的平均优势在任务数层面不算大。判分器是 Codex,基线之一也是 Codex,打分模型与被评模型的亲缘关系值得留意。评测体系全由 Inherent 自建,等独立复现。