谷歌 Co-Scientist 两天复现十年 AMR 假说,AML 新药体外 IC50 低至 2 nM

2026-09-05

谷歌用 Gemini 2.0 多智能体 Co-Scientist 做假设生成,Elo 随测试时计算持续上升。AML 体外筛出 binimetinib IC50 低至 2 nM、KIRA6 在 KG-1a 上 10 nM,并两天内独立复现尚未发表的 cf-PICI 机制。

这篇在解决什么

科学家同时卡在两头:子领域越挖越深,真正的跳跃又经常来自跨学科拼接。文献量已经大到个人读不完。「Deep Research」类工具能把已有工作综述清楚,但停在综述,不会自己提出可拿去实验室验证的新假设。

Co-Scientist 要做的是下一档。科学家用自然语言写下研究目标、偏好和实验约束,系统持续生成、辩论、进化假设,并给出实验方案。底座是 Gemini,验证集中在生物医学。

方法

底座用的是 Gemini 2.0,所有智能体共用,框架自称不绑死某一个模型。Supervisor 把研究目标解析成研究计划配置,往异步任务队列里派工。六个专职智能体对标科学方法的不同步骤:

科学家可以随时用自然语言加约束、塞自己的想法、否决方向。工具包括网页检索、私有文献库,以及 AlphaFold 这类专用模型。默认门控是对齐目标、说得通、新颖、可检验、安全。

结果

203 个研究目标(以生物医学为主,也夹了数学和物理)按生成时间切成十个桶。最优假设和 top-10 平均的 Elo 都随测试时计算往上走,图上最优大约从 1300 附近爬到 1600,没有看到饱和。15 道由七位生物医学专家出的难题上,系统最终在 Elo 上超过当时的 Gemini 2.0 Pro Experimental、Flash Thinking、OpenAI o1、o3-mini-high 和 DeepSeek R1。o3-mini-high 和 R1 用更少计算就有竞争力。Elo 是系统自己打的分,不是实验室金标准。

11 道题的盲评里,出题专家给 Co-Scientist 的平均偏好名次是 2.36(1 最好、4 最差),新颖性 3.64、影响力 3.09(五分制)。同期 Gemini 2.0 Flash Thinking 平均名次 2.73,新颖性和影响力都是 3.09;o1 新颖性 3.55、影响力 2.82。这是主观偏好,样本也小。

压秤的是体外实验。

AML 老药新用。专家从带临床前证据的候选里挑了 5 个,binimetinib、pacritinib、cerivastatin 能压细胞活率。binimetinib 在多数 AML 系上 IC50 低至 2 nM,对照淋巴母细胞系 TK6 高得多;MOLM-13 上图示 IC50 为 0.01 μM(约 10 nM),pacritinib 0.73 μM,cerivastatin 6.73 μM。完全没有 AML 临床前证据的三个新候选里,IRE1α 抑制剂 KIRA6 能打:KG-1a 上 IC50 10 nM,TK6 180 nM,差 18 倍;NOMO-1 144 nM,MOLM-13 和 HL-60 分别是 1750 nM 和 870 nM。nanvuranlat 和 leflunomide 在 MOLM-13 上基本没效。7 组双药或三药组合在 MOLM-13 上以协同为主,例如 JNJ-64619178+selinexor,以及 JQ1+olaparib+MSA2;在 TP53 突变的 KG-1a 上协同和拮抗混杂。

肝纤维化。系统提出三个表观遗传靶点,专家挑了对应药物,两个在人肝类器官上有抗纤维化活性且不明显伤细胞,其中一个是已批准抗癌药 vorinostat。

抗菌素耐药。只给很少背景,系统两天内独立提出:能形成衣壳的噬菌体诱导染色体岛(cf-PICI)靠结合多种噬菌体尾巴扩大宿主范围。这条结论和合作组当时尚未完成同行评审的实验对上,人类那条线大约做了十年(2015–2024)。

为什么重要

这是目前少有的、把多智能体假设引擎一路推到湿实验的工作。对做药物筛选的人,它展示了一条「文献推理 → 专家过目 → 细胞系可行性检查」的短闭环,组合爆炸不必先铺大规模湿实验矩阵。架构不绑死某一个模型,后面换更新的 Gemini 可以接着跑。

它还不是自动科学家。体外有效离体内和临床隔着药代、微环境和病人分层。Elo 是自评分,专家盲评只有 11 道题。能跟的人,更该把它当假设加速器,不当结论生成器。

局限与存疑

论文自己写得很清楚:知识面被开放获取文献卡住,付费墙和阴性结果都缺,会把文献里不可重复的结论接着传下去;底座会幻觉;三项湿实验都还是初步验证。更大的风险是科研方向被模型偏好拉齐,以及没有严格同行评审时批量产出低质量论文、加重可重复性危机。

另外几处读完觉得站不稳。Elo 自评价和「假设变好」绑在同一套辩论机制上,有自我加分的味道;专家偏好与 Elo 同向,但 n=11,论文也说不足以下可靠结论。AML 实验是细胞活率,不是机制验证,KIRA6 在不同亚型上差两个数量级,更像在提示需要生物标志物,不是已经有一个广谱候选。肝纤维化和 AMR 的关键实验细节大多在共同发表的 Cell / Advanced Science 里,这篇 Nature 正文给的是叙事级复述。

术语

原文与代码

社区讨论

全部论文解读