谷歌把Co-Scientist接到真实实验,作废级幻觉从90%降到4%

Accelerating Scientific Research with Gemini in the Real-World

Samuel Schmidgall, Xiaokai Zhu, Marian Shaw, Lin Yang, Valentin Liévin, Jingyun Yang, Yuchen Zhuang, Tim Strother, Alex Bijamov, Min Woo Sun, Anil Palepu, Justin Chen, David Steiner, Jacqueline Shreibati, Wei-Hung Weng, Yilin Zhao, Xingjian Hu, Nicholas Zahn, Sadhya Garg, Julia Kirby, Yuxiang Gan, Jiaoli Li, Divy Thakkar, Shekoofeh Azizi, David Racz, Juraj Gottweis, Vivek Natarajan, Chenglin Wu, Tal Danino, Keran Rong, Haozhe Wang, Benoit Schillings, Yong Cheng, Quoc V. Le, Tao Tu

cs.AI

2026-08-27

谷歌DeepMind把Gemini多代理Co-Scientist接到真实CVD炉与大肠杆菌实验,一次长出单层MoS2等二维半导体;端到端写论文时,作废级结果幻觉从Agent Laboratory的90%降到4%。

这篇在解决什么

能在计算机里「做完一篇研究」的代理,和真正能把配方送进实验室的系统,中间还隔着一层。前者优化自动审稿分数,容易编造结果;后者往往锁在窄任务上,比如一条固定合成路线。缺的是一套能跨材料、生物、计算科学切换人机分工,并且能核对实验记录的通用框架。

Google DeepMind 把此前偏假设生成的 Gemini 多代理系统 Co-Scientist 接到可执行的实验面上:给一条研究指令,系统走完构思、做实验、写论文三步,按领域约束决定人插手多少。

方法

三条流水线都用进化搜索。构思阶段用温度 1.6 采样一堆假设,LLM 评审新颖性、可检验性和安全性,再用 TrueSkill 式贝叶斯评分加 UCB 选择父母,交叉概率 0.7、变异 0.3,默认 10 代后取最高分。实验阶段先在小数据上搭脚手架,再切到全量运行;失败程序拿报错做反思,最优程序缓冲区每代乘 0.97 衰减,逼着继续改。写论文时按章节搭骨架,再用并行求解器改稿,审稿分数要扣抄袭和幻觉。

可靠性靠两层。软的一层把稿件分数写成「审稿分 − 0.5×抄袭 − 1.0×幻觉」,幻觉项对上执行日志,编造结果最多扣满 1 分,盖过审稿分通常不到 0.3 的涨幅。硬的一层把文中数字抠出来和日志对,对不上就改写成日志里的值;实验阶段如果没有任何有效日志,直接停写。安全上也分两层:入口拒危险方向,构思和计划阶段再用 LLM 做二元伤害判定并回写反馈。

人机分工按领域收放。材料合成由系统出配方、人装样跑炉;大肠杆菌表型预测由系统搭视觉管线、专家改任务框并做湿实验;医疗回答架构和 50 个 AI 题目的论文生成,指令给出后不再插手。

结果

材料侧,系统在自建 1 英寸石英管 CVD 炉上找替代剧毒 TiCl4 的前体,从 272 条配方里挑出六氯乙烷 C2Cl6,人机共迭代 25 轮。产物 XRD 在 2θ=7.8° 出现强峰,层间距约 1.13 nm,STEM 面内 d 间距约 2.51 Å,形貌和成分与湿法刻蚀的 Ti3C2Tx MXene 接近。论文自己写明:产率低、易氧化,没有截面原子级 STEM,不能定相。二维半导体这边,系统只拿炉子几何和可用药品,一次长出单层 MoS2、MoSe2、WS2;MoS2 三角形边长超过 50 μm,拉曼 E2g 与 A1g 峰间距约 21 cm⁻¹。完整进化构思大约一天算力;换成 Gemini 3 Deep Think 后几分钟出可执行配方,一小时内完成三种材料首次生长,但晶体更小、更不规则。

生物侧,任务是从稀疏菌落扫描图插值未见过的 IPTG 浓度下的群体运动形态。数据当时未发表。系统用 Gemini 3 Pro Image 做 leave-one-out,每次生成 16 个候选、Gemini 2.5 Pro 挑最好。四个形态指标里,平均半径、极性偏心率、周向强度变异系数与实验曲线无显著偏离(交互项 p 分别为 0.593、0.451、0.712),圆形度显著更圆滑(p=0.002)。对照株 pLac-gfp 被正确判成没有剂量反应。这是插值,不是外推到新线路。

计算侧,系统在 1282 条合成医疗问句上搜出 AgentH:分诊、拆问、并行出 28–48 个候选、淘汰赛加三评委、最多五轮审改、引用核对、压到约 2000 字。每问大约 40–80 次模型调用。用 Gemini 3.5 Flash 当裁判、长度校正后,HealthBench Hard 得 0.377,超过 GPT-5 的 0.334;Professional 上 AgentH 以 0.643 排第一。三位执业医师对 106 题盲评,伤害可能性相对裸模型 Gemini 3.1 Pro 下降(p=0.0486),其余八个维度没有统计显著差。自动裁判和医生偏好对齐很差。

论文生成是更干净的对照:50 个 AI 题目 × 三种条件,30 位专家、450 份评审。

指标Co-Scientist去掉可靠性模块Agent Laboratory
使论文作废的结果幻觉(≥5)4%46%90%
完全编造结果(≥8)0%40%44%
方法与代码严重不符(≥5)24%52%100%
高严重衍生内容(≥3)16%50%60%

有害研究方向拒绝率 98.7%(691/700),误拒无害方向 3.1%。关掉入口拒绝后,伦理模块仍把 96.3% 的想法和 96.7% 的计划评成安全。

为什么重要

这条工作把「AI 科学家」从模拟器里拖到三种真实实验面上,但自主程度差得很远。CVD 仍然靠人装样和选配方,生物靠专家改题,真正全自动的是写代码和写论文。对要跟进的人,更该看可靠性模块:同样的 Gemini,去掉惩罚和日志裁剪,作废级幻觉从 4% 跳回 46%。AgentH 说明推理时架构搜索能刷长度敏感的医学基准,医生盲评却只在伤害这一项上站得住。刷自动裁判不等于临床更好。

局限与存疑

MXene 相还没钉死,配方没跨实验室验证。菌落预测停在已知 IPTG 梯度插值,模型还会把菌落画得发荧光绿,得靠拒绝采样滤掉。AgentH 没算力预算,每问几十次调用,上线交互用不上;早期不加长度惩罚时,系统靠把回答写长来刷分。日志核对只对有确定 stdout 的计算实验成立,湿实验噪声和仪器漂移对不上。1.3% 漏网全是中性措辞的两用研究。组合多个「看起来安全」的子任务会不会拼出有害轨迹,这套按单条假设审查的架构没有覆盖。

术语

原文与代码

社区讨论

相关论文

全部论文解读