ScientistTwo: Pioneering the Human Knowledge Frontier with Autonomous AI
Jaehyun Nam, Jinsung Yoon, Yanzhou Pan, Yubo Wang, Rui Meng, Parthasarathy Ranganathan, Tomas Pfister
cs.AI
2026-09-17
谷歌 ScientistTwo 给定顶会论文当科研题,自动挖缺陷、做实验、写稿并模拟审稿。107项做成86项,相对人类基线平均提升25.2%。
现有科研智能体大多卡在两件事上。一件是只盯一个标量指标、一个数据集做搜索,产出的是更高的分数,不是一篇能过顶会审稿的研究。另一件是没有人类科研那种证据闭环:主实验跑完就停,不会系统做 ablation,也不会按审稿意见补实验再改稿。
ScientistOne 已经能吐出论文和代码,但 ScholarPeer 均分只有 3.8,Stanford Agentic Reviewer 接受率为 0。谷歌 Cloud AI Research 的 ScientistTwo 把目标抬高一档:人只给出一道题,通常是一篇已中 ICLR、ICML 或 NeurIPS 的论文及其代码;系统自己挖缺陷、提方法、跑完整实验、写成可发表稿,并留下可复现仓库。
整条流水线是一组专用智能体,每步都配 critic。过了就进入下一步,不过就按反馈改,预算耗尽就丢掉。
限制抽取器反复从原论文里抠可改进的弱点,直到 verifier 认为这张清单够用来出新想法。想法生成器围着这些弱点出一批 seed,用谷歌搜索拉到的两篇参考文献做 novelty 打分,再按新颖度排序。
编码智能体先在数据子集上复现人类基线,再实现候选想法。critic 给出 Bad、Good 或 Engineer 三档:差的砍掉,有潜力的最多调两轮工程,过了再上全集。演化阶段把成功和失败的实验痕迹喂给 Idea Evolver,同时继续从高新颖度 seed 里抽还没测过的想法,避免围着早期点子打转。最多四轮,攒够四个成功想法就停。
选出最佳想法后,ablation planner 按组件拆开验证。某个模块没用,就再改一版,只在全集数字确实更好时才替换。随后用 PaperOrchestra 起草 ICLR 2025 格式稿,交给 ScholarPeer 打分。低于 8 分就规划补充实验,Rebuttal Agent 真去跑,再改表格和表述,最多两轮。Meta-Review 仍觉得不够,就把审稿意见灌回方法层,ablation 和写稿整条重来,最多一次。
非编码步骤默认 Gemini 3.6 Flash。写代码、做 ablation、跑 rebuttal、改稿走 Claude Code,后端是 Opus 4.8。
评测集 107 道题:NeurIPS 2025 已接收 38 篇、ICLR 2026 已接收 5 篇、ICML 2026 Spotlight 64 篇。做成 86 项,成功率 80.4%。相对人类 SOTA 的相对增益平均 25.2%,中位数只有 7.7%。少数暴涨任务在拉均值,中位数更接近多数任务上的真实步幅。
审稿侧用两个 AI 审稿器。ScholarPeer 写稿循环里就在用,属于 in-distribution;Stanford Agentic Reviewer 开发时没见过,当 held-out。
| 系统 | ScholarPeer 均分 / 接受率 | Stanford 均分 / 接受率 |
| ScientistOne | 3.8 / 14.3% | 4.1 / 0% |
| ScientistTwo | 7.5 / 91.9% | 5.7 / 72.1% |
| 人类 ICLR 2026 已接收 | 6.8 / 60% | 5.2 / 60% |
| 人类 NeurIPS 2025 已接收 | 6.2 / 65.8% | 5.5 / 76.3% |
| 人类 ICML 2026 Spotlight | 6.9 / 79.7% | 6.1 / 96.9% |
和只改超参、追单指标的 AutoSOTA 比,ScientistTwo 做成的题更少(86 对 105),成功案例的平均增益更高(25.2% 对 7.5%)。ICLR 2026 那 4 道重叠题上排名反过来:AutoSOTA 平均 7.2%,ScientistTwo 只有 3.8%。附录逐篇核对,AutoSOTA 的五处改动全是几行配置,没有新的算法模块。
去掉模拟审稿,初稿在两个审稿器上接受率大约 47%–49%。加一轮 rebuttal 后 Stanford 接受率到 73.5%。第二轮 ScholarPeer 继续涨到 93.9%,Stanford 掉到 69.4%。对内部审稿器的过拟合已经露头。
完整性审计覆盖 49 篇:分数可复现 49/49,规则违规 0,幻觉引用 0,方法与代码对齐 49/49。关掉对应修正智能体,幻觉引用会到 19 条,方法-代码对齐掉到约 38/49。
9 位人类审稿人对 33 篇 NeurIPS 衍生稿打 1–5 分。独立评分全面高于 3.0,总体 3.7。和人类已接收论文两两比,总体打平(3.0);实验部分偏向 ScientistTwo(3.3–3.5),方法严谨性仍偏向人类(2.9)。
NeurIPS 那 33 题平均约 2.5 天、3765 美元(token 加虚拟机),结论里写成约 3800 美元。时间和钱都堆在想法演化、实验执行和审稿循环上。
连续发现有一个干净例子。增量 BPE 上先做出 VD-STrans,相对人类 SOTA 高 10.9%;拿自己当先验再跑,BXT-Transducer 再高 9.6%;第三轮 SBR-Transducer 再高 8.2%。
这是目前把自主科研从「刷一个数」推到「顶会投稿包」最完整的系统之一:多数据集评估、ablation、按审稿意见补实验、引用核查、代码对齐都进了流水线。对已经有可复现代码的机器学习问题,两三天里可以交出一篇对标已接收稿的增量改进。
不要把它读成智能体已经能从空白处开拓新方向。任务定义就是在一篇已中的论文上再推一步。人类审稿人在方法上仍压它一头。Spotlight 档的 Stanford 分它也没追上:5.7 对 6.1,接受率 69.4% 对 96.9%。25.2% 的平均增益看着大,7.7% 的中位数才是多数任务的体感。
单次约 3800 美元,学术组当常规工具不划算,工业实验室做定向挖潜可以试。代码后端换成 Gemini 3.8 Flash 的 Antigravity 后,5 道 ICLR 题成功率从 80% 掉到 60%,对 Opus 级编码能力的依赖不小。
作者自己写了两条:还做不到 Spotlight 或 Oral 那种范式级新理论;单次成本约 3800 美元,多数学术组用不起。
其余数字自己会说话。ScholarPeer 91.9% 接受率是自己人打自己人,不能当成顶会中稿率。Stanford 仍是另一个 AI 审稿器,不是真人程序委员会。107 题里失败了 21 题,成功口径是「做出了超过原论文的版本」,不是「提交就能中」。同一批 ICLR 题上 AutoSOTA 增益更高,说明新方法并不总是比把原方法调透更赚。均值远高于中位数,少数暴涨任务在抬轿。评测题还经过可复现过滤,已经偏工程友好。