GPT-4 加 18 个化学工具自治规划合成路线,ChemCrow 发现新发色团

ChemCrow: Augmenting large-language models with chemistry tools

Andres M Bran, Sam Cox, Oliver Schilter, Carlo Baldassari, Andrew D White, Philippe Schwaller

physics.chem-ph, stat.ML

2023-04-12

把 18 个专业化学工具接到 GPT-4 上,ChemCrow 自治规划并执行了驱蚊剂 DEET 和三个有机催化剂的合成,还指导发现了一个新发色团;但 GPT-4 当评审分不清流畅的错答案和正确答案。

这篇在解决什么

计算化学几十年积累了不少趁手的工具:逆合成规划、反应预测、分子性质检索。但每个工具都有自己的界面和学习曲线,化学家外的人根本用不起来。LLM 号称通用,遇到化学问题却频繁编造分子式和反应条件。这篇 EPFL 的工作把两边接起来:让 GPT-4 当调度员,专业工具当手脚。

方法

ChemCrow 用 LangChain 搭了一条 ReAct 风格的循环:模型先写 Thought,再决定调哪个工具,拿到 Observation 后继续想。工具分四类共 18 个:

安全设计是硬约束:任何合成任务先过受控品和危险品检查,命中即停。让它合成硝化甘油,系统直接拒绝并给出警告。

结果

任务结果
驱蚊剂 DEET自治完成规划与执行,在 IBM RoboRXN 上跑通;执行中的溶剂不足等错误由 LLM 驱动的修正循环自行修复,无需人工
三个硫脲有机催化剂(Schreiner、Ricci、Takemoto)全部自治合成成功
新发色团发现给定目标吸收峰 369nm,训练随机森林筛选候选,建议分子实测 336nm,确认为新发色团
14 个任务评审四位专家化学家整体偏好 ChemCrow,任务越复杂优势越明显;GPT-4 仅在简单记忆型任务(DEET、扑热息痛合成)上占优

最后一行是全文最有意思的发现:让 GPT-4 当评审,它分不清明显错误的 GPT-4 答案和 ChemCrow 的正确答案。一个具体例子是 Takemoto 催化剂的合成:GPT-4 给出带多余保护/脱保护步骤、危及手性中心的多步路线,ChemCrow 给出单步路线加条件,评审 GPT-4 反而更喜欢前者,还夸它「理解深刻」。

为什么重要

对 AI4Science 从业者,这是工具增强 LLM 的标准范本:模型不背化学知识,只做调度和自然语言接口,事实性交给专业工具。发色团案例展示了人机协作发现新材料的最短路径。评审部分的发现同样值得记住:LLM 评审偏爱流畅性,被评审对象是 LLM 输出时这个偏差不可忽视。

局限与存疑

作者自己列了四条:工具无法完全修复 LLM 的错误逻辑;LLM 评审不可靠,只能靠小规模专家评审;闭源 API 模型影响可复现性;性能上限受底层工具约束,ChemCrow 不可能超越它调用的工具。任务挑选也可能有隐含偏差。

复现性测试值得注意:同一任务独立跑 5 次,产物全对,但其中 2 次把 SMILES 字符串误读成反式烯烃,导致机理解释跑偏。执行层稳定,解释层不稳。

术语

原文与代码

社区讨论

相关论文

全部论文解读