How Molecular Generative Models Organize Molecular Identity
Raul Ortega-Ochoa, Tejs Vegge, Jens S. Bakander, Luis Mantilla Calderon, Alan Aspuru-Guzik, Tonio Buonassisi
cs.LG, physics.chem-ph
2026-08-07
把分子身份定义为六档等价关系并拉回三个分子生成模型(MolMiner、HierVAE、GDSS)的潜空间,发现内部按逐块常数的化学区域组织、由粗到细分块;凝聚性训练中先稳定,粒度仍在变,导航性需验证不能默认。
分子生成模型(变分自编码器、扩散模型、自回归 transformer)被用来做药物和材料发现。一个常见做法是把它们的潜空间当成一张「化学地图」:在两个点之间插值,以为分子会平滑地从一个变形成另一个;沿某个方向走,以为能优化某个性质。这套用法成立的前提是,潜空间的几何跟分子身份平滑对应。但它真的对应吗?一直没人直接刻画过这些模型内部到底怎么排布不同的分子。这篇就是把「分子身份」显式定义出来、再拉回生成过程,去看模型内部的版图长什么样。
核心招数是把「什么算同一个分子」变成一个明确的等价关系:从最细到最粗共六档,精确 SMILES、InChIKey 前 14 位、Murcko 骨架、Murcko 泛化骨架、分子式、元素组成。然后把这套身份拉回生成过程:在潜空间里取很多点(每个点都暴露解码器的随机性,即所谓的 random tape η),解码出分子,给每个分子贴上身份标签,再看这些身份怎么铺满潜空间。这样就把模型的「剧目」暴露出来,一个固定的划分,决定了它能产出哪些分子。
三个架构:MolMiner(以物化性质为条件的自回归 transformer)、HierVAE(层级图变分自编码器)、GDSS(基于分数的图扩散模型)。在二维截面上取样,用 AUC(W,A) 衡量邻域的化学凝聚性:同一个邻域里取一对分子比跨邻域取一对更相似的概率(相似度用 ECFP 指纹上的 Tanimoto 算),0.5 是随机水平。
| 模型 | AUC(W,A) | 邻域内中位 Tanimoto | 跨邻域中位 Tanimoto |
| MolMiner | 0.842 | 0.203 | 0.121 |
| HierVAE | 0.869 | 0.203 | 0.115 |
| GDSS | 0.526 | 0.083 | 0.080 |
MolMiner 和 HierVAE 的邻域是化学凝聚的,AUC 在 0.84、0.87,远高于 0.5 的随机线。GDSS 接近随机(0.526),它的潜坐标几乎不决定生成哪个分子,大部分「分子身份的变化」其实来自解码器的随机性,而不是坐标本身。
最关键的一条:凝聚性跟度量的平滑性是脱钩的。HierVAE 的凝聚性很强(AUC 0.869),但它潜空间里的欧氏距离几乎不预测化学相似度(R²euc 只有 0.05,余弦也一样);MolMiner 部分预测(R²euc 0.33)。换句话说,「邻域局部有组织」推不出「沿坐标平滑插值,输出就平滑变化」。
边界结构是「由粗到细」的:解码的早期步骤先切出几大块宽区域(对应不同的起始片段),后续步骤在各块内部继续细分,而块与块之间的粗边界基本不动。训练层面,化学凝聚性很早就稳定下来,但每个邻域能生成的不同分子数(粒度)还在持续变化。一个模型完全可以「局部有组织」,同时还在重新洗牌它到底能产出什么。
结论对做潜空间优化和插值的人(不止分子领域)有用:潜空间不会自动变成一张平滑、可导航的输出地图,得自己验证。具体到三点。GDSS 这类扩散模型可能几乎没有坐标控制力,所谓的「潜变量」并没有真正在驾驭分子;即便一个模型局部有组织(高 AUC),欧氏距离也可能是很差的代理,基于梯度的潜空间优化会被带偏;凝聚性相近的检查点,能生成的东西可能很不一样。务实的结论是:在信任潜空间漫游去做发现之前,先用经验方法测一测它到底可不可导航。