ChemCrow: Augmenting large-language models with chemistry tools
Andres M Bran, Sam Cox, Oliver Schilter, Carlo Baldassari, Andrew D White, Philippe Schwaller
physics.chem-ph, stat.ML
2023-04-12
把 18 个专业化学工具接到 GPT-4 上,ChemCrow 自治规划并执行了驱蚊剂 DEET 和三个有机催化剂的合成,还指导发现了一个新发色团;但 GPT-4 当评审分不清流畅的错答案和正确答案。
计算化学几十年积累了不少趁手的工具:逆合成规划、反应预测、分子性质检索。但每个工具都有自己的界面和学习曲线,化学家外的人根本用不起来。LLM 号称通用,遇到化学问题却频繁编造分子式和反应条件。这篇 EPFL 的工作把两边接起来:让 GPT-4 当调度员,专业工具当手脚。
ChemCrow 用 LangChain 搭了一条 ReAct 风格的循环:模型先写 Thought,再决定调哪个工具,拿到 Observation 后继续想。工具分四类共 18 个:
安全设计是硬约束:任何合成任务先过受控品和危险品检查,命中即停。让它合成硝化甘油,系统直接拒绝并给出警告。
| 任务 | 结果 |
| 驱蚊剂 DEET | 自治完成规划与执行,在 IBM RoboRXN 上跑通;执行中的溶剂不足等错误由 LLM 驱动的修正循环自行修复,无需人工 |
| 三个硫脲有机催化剂(Schreiner、Ricci、Takemoto) | 全部自治合成成功 |
| 新发色团发现 | 给定目标吸收峰 369nm,训练随机森林筛选候选,建议分子实测 336nm,确认为新发色团 |
| 14 个任务评审 | 四位专家化学家整体偏好 ChemCrow,任务越复杂优势越明显;GPT-4 仅在简单记忆型任务(DEET、扑热息痛合成)上占优 |
最后一行是全文最有意思的发现:让 GPT-4 当评审,它分不清明显错误的 GPT-4 答案和 ChemCrow 的正确答案。一个具体例子是 Takemoto 催化剂的合成:GPT-4 给出带多余保护/脱保护步骤、危及手性中心的多步路线,ChemCrow 给出单步路线加条件,评审 GPT-4 反而更喜欢前者,还夸它「理解深刻」。
对 AI4Science 从业者,这是工具增强 LLM 的标准范本:模型不背化学知识,只做调度和自然语言接口,事实性交给专业工具。发色团案例展示了人机协作发现新材料的最短路径。评审部分的发现同样值得记住:LLM 评审偏爱流畅性,被评审对象是 LLM 输出时这个偏差不可忽视。
作者自己列了四条:工具无法完全修复 LLM 的错误逻辑;LLM 评审不可靠,只能靠小规模专家评审;闭源 API 模型影响可复现性;性能上限受底层工具约束,ChemCrow 不可能超越它调用的工具。任务挑选也可能有隐含偏差。
复现性测试值得注意:同一任务独立跑 5 次,产物全对,但其中 2 次把 SMILES 字符串误读成反式烯烃,导致机理解释跑偏。执行层稳定,解释层不稳。