可行性感知 Top-K 训练,2.6B 逆合成超过模板法

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

cs.LG, cs.AI, cs.CE, cs.CL

2026-08-19

用四千五百万条已校验反应按多答案方式训练 2.6B 化学模型,OOD 集前十可行性到 1.37,超过常规模板模型 LocalRetro 的 1.22。

这篇在解决什么

单步逆合成(SSRS)是计算机辅助合成规划的核心一步:给定目标分子,提出可能的反应和前体。这件事天生一对多,一条产物往往有多条合理切断。主流评测仍按「猜中那一条标注反应」打 Top-K accuracy,把多样性压成单答案。Insilico 自己先前用 URSA 框架和 ChemCensor 可行性分数做过对照,通用 LLM 有希望,但仍打不过 LocalRetro、MHNreact 这类常规 SSRS 模型。

这篇把评测口径改成「一次给出多条合理反应」,再把同一口径写进训练:用超大规模已校验反应做 SFT,再用 ChemCensor 和novelty 做强化学习,让一个 2.6B 的化学语言模型在 OOD 基准上超过常规工具。

方法

两套提示。Top-1:15 条自然语言模板各要 1 组反应物。Top-K:每条模板追加「给出 15 个不同答案」,每个目标抽 3 条模板,分别打分再平均。评测常规模型时,经 Syntheseus 每产物也出 15 条,两边对齐。

训练集约 4565 万条去重反应、368 万个独特产物,记为 CREED-CCV-2+USPTO-XL。CREED-CCV-2 来自 ChEMBL 化合物经虚拟合成引擎枚举,再与上一版 CREED 合并,用 ChemCensor v1.1.1 过滤,约 3600 万条。USPTO-XL 用 USPTO 产物再枚举,补上公开专利集「一产物一反应」的缺口,约 1060 万条。基座是 Liquid AI 的 LFM2 2.6B,SFT 5 万步,训练时就按 Top-K 出多条,并按预测的 ChemCensor 分排序。

强化学习用 GRPO,group size 8,温度 1,KL 系数 0.1。奖励是加权和:思维格式 0.1、合法 SMILES 0.5、ChemCensor 分 1.0(从 0–5 缩放到 0–1)、Top-K 去重 0.2、条数对齐 0.1。再加一项 novelty 1.0:反应物不在训练集穷举名单里且 ChemCensor 为正才给 1。最终模型叫 C3LM-LFM2-RFT-CC-NR。

主评测 URSA-expert-2026 是 100 个专家确认可合成、与公开反应集脱钩的新分子,用来压记忆。对照集 USPTO-50K-test-mini 是 USPTO-50K-test 的 497 条抽样。ChemCensor 的先例库默认公开 USPTO-full。

结果

URSA-expert-2026、Top-K 模式,Av. PT-Top-K CC 是每产物取前 K 条独特预测的 ChemCensor 均值再对产物平均。

方法MaxTop-3Top-5Top-10
Gemini 3.1 Pro1.911.691.461.08
GPT 5.51.941.681.461.05
LocalRetro2.111.851.591.22
MHNreact2.051.841.621.28
C3LM SFT, Top-11.621.060.720.38
C3LM SFT, 大数据 Top-K2.041.811.591.27
C3LM RFT-CC-NR2.161.941.731.37

同一数据从 Top-1 训到 Top-K,Max/@3/@5/@10 分别 +0.30/+0.62/+0.70/+0.60。数据放大六倍以上再 +0.12/+0.13/+0.17/+0.29。ChemCensor 奖励再 +0.04 量级,novelty 再 +0.08 量级。RFT-CC-NR 在这条 OOD 集上全面超过所列常规模型。

USPTO-50K-test-mini 上常规模型 Max 接近 4.8–4.9,作者指这更像先例泄漏:497 个产物里 481 个在公开 USPTO-full 里不超过 3 条反应,Av. PT-Top-10 更抗泄漏。RFT-CC-NR 该项 1.85,仅次于 MHNreact 的 1.90。

独特性对照显示,通用大模型和 MHNreact 探的是不同反应空间。相对 MHNreact,只有放大后的 C3LM(+0.4 条/产物)和 RFT-CC-NR(+0.3)给出更多独有可行反应;Gemini 3.1 Pro 是 −2.7,GPT 5.5 是 −3.0。30 个模型的并集把 Av. PT-Top-10 推到 1.81,单个最好才 1.37,作者据此主张 LLM 和常规工具做 ensemble。

为什么重要

给做合成规划的人两条可落地的改法。评 LLM 的 SSRS,不要再按单答案 Top-1 排;提示里明确要 K 条,排名会翻。训练也按 Top-K 走,多样性指标能翻倍以上。2.6B 专用模型加可行性奖励,可以在专家 OOD 集上超过通用前沿模型和模板/图方法。LLM 和常规模型的可行反应重叠有限,混着用覆盖更宽。

代价也清楚:优化目标和评测都绑在 ChemCensor 上,循环性是作者自己承认的设计选择,不是疏忽。

局限与存疑

作者承认优化和评测共用 ChemCensor,分数变好部分是在拟合这个代理。ChemCensor 不覆盖溶剂、条件、纯化这些实验室参数;先例主要来自专利;多样性只按 SMILES 精确匹配,没有反应类别或机理层面的比较。训练集由约 3 千条专家模板的虚拟引擎枚举,会偏向已编码的化学模式,漏掉真正的新反应类型。

URSA-expert-2026 只有 100 个分子,OOD 结论的方差不会小。novelty 奖励鼓励「训练集里没见过且 ChemCensor 为正」,可能把模型推向代理分数喜欢、化学家未必采用的切断。伦理节写了 CASP 的两用风险,评测分子与已知危险物数据库去重,但防护停在声明和制度合规,没有技术门控。

术语

原文与代码

相关论文

全部论文解读