69亿分子切18维网格,AdaptiveFlow把穷尽对接量砍掉5000倍

2026-09-05

把687亿Enamine分子按18个物化性质切网格,预筛约1200万代表分子即可圈定高分格子。FSP1用2200万次对接拿到283 nM抑制剂,PARP1筛出8.8 nM命中。

这篇在解决什么

实验高通量筛选一次通常只测几十万化合物,可合成类药空间的估计却在 10^60。虚拟筛选已经把搜索扩到数亿乃至数十亿分子,穷尽对接的账单跟着库一起涨。2018 年版 REAL Database 和 ZINC20 这类现成 ready-to-dock 公开库大约 15 亿分子;Enamine 的 on-demand 目录已经报到数万亿。再把每个分子都对接一遍,时间和钱都撑不住。

对接软件各自一套输入格式、采样算法和打分函数,GPU 与 ARM 也经常接不上。同一组人 2020 年的 VirtualFlow 最多演示到 16 万 vCPU。缺的是一套能把超大库切成可导航子空间、把一千多种对接协议接到云上、还能给机器学习当数据管线的开源平台。

方法

AdaptiveFlow 拆成三块:配体准备 AFLP、筛选引擎 AFVS、把两者串成一条命令的 AFU。真正新的东西是化学空间索引,不是新的打分函数。

Enamine REAL Space 2022q1-2 原始枚举 315 亿条 SMILES。立体异构体、互变异构、质子化态和 3D 构象展开后变成 687 亿 ready-to-dock 分子,99% 满足 Lipinski 五规则,独特 Murcko 骨架约 11 亿。每分子算 28 个物化性质,挑 18 个(分子量、logP、氢键供体与受体、可旋转键、TPSA、logS、芳香比例、形式电荷、sp3 碳比例、手性中心数等)做成网格。理论格子 244 亿个,实际被占住的 tranche 约 1200 万个,每个平均约 5600 个分子。

自适应靶点引导筛选 ATG-VS 的流程可以复述:

对接协议定义为采样算法乘打分函数,约 40 个程序拼出 1500 多种组合,含 DiffDock、TANKBind、EquiBind,以及 AutoDock-GPU、Vina-GPU。库同时给 SELFIES,方便生成模型。AWS Batch 加 spot 实例近线性扩到 560 万 vCPU;配体准备时抢占不到 0.1% 的 CPU 小时。QuickVina 2 用 Intel 编译器重编后又快了 18%。

结果

在 500 万分子子集、十个靶点(激酶、磷酸酶、GPCR、蛋白–蛋白界面)上,总共 10 万次对接的 ATG(含或不含那层 MLP)对 top-50 平均对接分数,打得过 100 万随机抽样。KRAS-G12V 上随机 1M 是 −11.83 kcal/mol,100K ATG −11.95,100K ATG 加主动学习 −12.11;CB1 上分别是 −13.93、−14.14、−14.25。口袋复杂、疏水面叠极性子口袋的靶点,主动学习增益更明显。生产规模用完整 687 亿库、关掉主动学习,ATG 仍用少得多的对接次数追上或超过 1 亿随机 ULVS 的顶尖分数。

湿实验做了两个靶。

靶点对接规模合成与测试关键数字
FSP1预筛 1200 万 + 主筛 1000 万订 42 个,合成 33 个afi-FSP1-1 的 Ki 0.283 μM、Kd 98 nM
PARP1预筛后主筛 1 亿合成 160 个7 个抑制剂;iParp1 的 IC50 8.8 nM

FSP1 首轮 33 个化合物里,2 个在 10 μM 下抑制超过 50% 且热位移至少 1.5 °C。共晶结构确认抑制剂占 coenzyme Q 口袋,姿态和对接预测一致。细胞热位移里 afi-FSP1-1 和 afi-FSP1-2 分别把人源 FSP1 稳了 2.8 °C 和 3.1 °C。后续按 afi-FSP1-1 结构再筛 20 个类似物,又拿到 4 个三位数纳摩尔到低微摩尔的 Ki。作者拿自己 2020 年 KEAP1–NRF2 无偏筛 13 亿分子才出纳摩尔命中做对照,这次 FSP1 2200 万次对接就够。

PARP1 的 160 个合成分子经两点浓度酶活筛出 7 个抑制剂,4 个 IC50 低于 250 nM。最强的 iParp1 酶活 8.8 nM,接近 FDA 药 olaparib,但晶体里看到的是水解产物,细胞活性被膜通透拖住。

为什么重要

对做虚拟筛选的人,这是 VirtualFlow 的工程升级加一套化学空间索引。69 亿 ready-to-dock 库、SELFIES、1500 种协议、GPL-2.0 开源,够当公共基础设施。ATG 的卖点很具体:FSP1 这种口袋,2200 万次对接就能出可结晶的纳摩尔抑制剂。压缩后每种 3D 格式大约 50 TB,挂在 AWS Open Data,不必自己枚举。

对接分数领先不等于湿实验命中率领先。生产规模对照只比了 docking score,没有同一靶点上 ATG 对随机 ULVS 的实验头对头。主动学习也没上到 69 亿全库。

局限与存疑

作者写了:化学空间聚焦的效果跟口袋有关,特征贫乏的口袋增益小。生产基准关掉了主动学习。那层 MLP 用对接分数当监督信号,而对接分数和真实亲和力的相关性本来就弱,等于用噪声标签再筛一轮。

FSP1 晶体用的是四足类祖先序列重建蛋白,与人源一致率 72.5%。CETSA 在表达人源 FSP1 的 HEK293 上做了,结构到人源活性仍隔了一层。PARP1 最强命中水解、透膜差,离成药还早。库是 2022 版 REAL Space,正文已经承认可购买空间涨到数万亿,这套网格会过时。Enamine 员工是共同作者。ChemAxon JChem 仍是配体准备的默认路径,开源备选是后加的。

术语

原文与代码

社区讨论

全部论文解读