微软Orbformer预训练2.2万构型,断键计算独达化学精度

2026-08-26

微软 Orbformer 在 2.2 万个平衡与解离构型上预训练可迁移波函数,微调后在 Diels–Alder 与五条断键路径上唯一稳定收敛到 1 kcal/mol。

这篇在解决什么

量子化学里,断键几乎是最难算准的一类问题。分子处于平衡几何附近时,电子波函数通常弱关联,coupled cluster 这类单参考方法就能把能量压得很准。键一拉开,电子结构变成强关联、多参考:没有默认方法能通吃,活性空间往往要对每个体系单独调,代价也通常比单参考更难看。

传统 ab initio 还有一笔隐形成本。每次计算都从零解 Schrödinger 方程,哪怕两个分子只差一个甲基。电子结构明明有大量可复用的局部模式,这笔账却付了又付。深度量子蒙特卡洛(deep QMC)用神经网络表示波函数、靠能量最小化训练,理论上适合把这些共性存进一套参数。此前的可迁移尝试最多预训练大约 700 个构型,规模还不够当实用工具。

方法

Orbformer 把分子构型 M(核坐标和电荷)当成网络输入,而不是某个待优化问题的固定参数。同一套权重因此能描述不同大小、组成和几何的分子。波函数是 Jastrow 因子乘上若干广义 Slater 行列式之和:电子特征走 Electron Transformer,轨道由 Orbital Generator 按核环境动态生成。设计原则是局域性。粒子间相互作用随距离衰减,轨道被约束为局域,方便在相似化学环境里复用。

训练是变分蒙特卡洛的推广。外层对训练分布里的分子采样,内层对当前 |Ψ|² 采样电子坐标,最小化哈密顿量期望。不需要任何标注能量,电子数据由网络自己生成。

预训练数据集叫 Light Atom Curriculum(LAC),共 22,350 个构型,最多 24 个电子,元素限于 H、Li、B、C、N、O、F,并刻意加入弯折、拉伸、断键等非平衡几何。用 CCSD(T) 的 T1、D1 和 |%TAE| 诊断,大约 20% 到 45% 的结构呈多参考特征。预训练分三阶段:先做不超过 10 个电子的弯折和拉伸(20 万步,约 320 A100 小时),再做不超过 10 个电子的全部几何(同样约 320 小时),最后上全部 LAC(40 万步,约 4000 A100 小时)。

要到 1 kcal/mol 的化学精度,还得从预训练权重出发,把一组目标构型绑在一起做可迁移微调,通常是同一套原子核的整条路径,而不是每个几何点单独优化。

把规模撑起来靠几处训练改动。新分子的电子样本先用 Unadjusted Langevin 快速烧入,再切回带接受拒绝的 MALA,对齐目标分布。多参考下 Hartree–Fock 初始化不可靠,所以不用它,改加一项惩罚,迫使多个行列式均衡贡献,避免训练早期某一个独占、模型塌成单行列式(determinant collapse)。网络能在 TF32 下稳定训练,电子 batch 比 Psiformer 至少小 4 倍。

结果

Diels–Alder(乙烯加丁二烯)的协同过渡态有 46 个电子,远超预训练分布。Orbformer 的活化能几乎贴上实验值,总反应能也收敛到实验值 1 kcal/mol 以内。分步双自由基路径的活化能比实验测到的那条大约高 9.9 kcal/mol,协同路径比分步大约低 10 kcal/mol,和现有实验与理论共识一致。传统波函数方法里,只有多参考 coupled cluster 在小基组或人为限制组态时能对上实验。

五条断键最小能量路径覆盖乙烷、甲酰胺、1-丙醇、2-氨基丙-2-醇和 L-丙氨酸,每条 20 个点,最多 48 个电子。没有实验势能面,参考能量来自高成本单点 deep QMC。相对能量的平均绝对误差上,从 LAC 微调的 Orbformer 落在 DFT 与 NEVPT2、MRCI、MRCC 组成的 Pareto 前沿上,或明显超前。它随算力单调变准;经典方法经常做不到系统收敛。

设置相对从零训练的代价
整条路径联合微调 vs 单点约 20× 更便宜
乙烷(在 LAC 内)到 1 kcal/mol约 16×
1-丙醇(略大于 LAC)到 1 kcal/mol约 6×
L-丙氨酸到 5 kcal/mol约 8×
L-丙氨酸到 1 kcal/mol只快约 10%

相对此前最好的单点神经网络 ansatz,到达化学精度的成本大约降了两个数量级。TinyMol 基准上,预训练后的 Orbformer 在分布内和分布外都是最优,到达 1 kcal/mol 至少比从零训练快一个数量级。Gao 等人的可迁移模型在分布外会被更多预训练伤害;Orbformer 仍然受益。

模型还自己学出了碳原子上恰好两个完全局域的芯轨道,这不是架构写死的。辛烷与庚烷的 Slater 矩阵在局部环境相同的一端几乎一样,轨道确实在分子间复用。烷烃微调覆盖到 106 个电子。

为什么重要

这是把「解 Schrödinger 方程的成本摊到许多分子上」做成可用工具的一次落地,不是又一篇只报绝对精度的 deep QMC 表演。代码和权重已开源。如果在算有机小分子的断键、过渡态、多参考反应路径,可以拿来当高精确参考,尤其当活性空间难选、基组敏感的时候。

它还不是零样本基础模型。化学精度必须微调;公开 checkpoint 只覆盖那七种轻原子。作者设想的大规模用法,是给更便宜的反应力场当数据生成器。

对做神经网络波函数的人,可复用的是 ULA/MALA 烧入、行列式均衡惩罚和局域可组合约束。

局限与存疑

作者自己划了范围:不处理离子,不处理 Sz 不是 0 或 1/2 的自旋指定,不做激发态;预训练元素集合封死。多行列式时,可组合约束并不保证大小一致性。远离预训练分布时,预训练红利会在长微调后几乎消失,L-丙氨酸到 1 kcal/mol 只快 10% 就是证据。

断键路径上的「化学精度」对照的是另一套更贵的 deep QMC,不是实验势能面。用同类变分方法当金标准有自指风险,文中也没有系统对标扩散蒙特卡洛。Diels–Alder 对实验更硬,但只覆盖一个反应。

「唯一稳定收敛到 1 kcal/mol」限于文中那组对照方法。没有测过渡金属,大共轭体系也没有专门实验。公开权重不能零样本用。

术语

原文与代码

社区讨论

全部论文解读