Zatom-2: Multitask Pretraining on Atomistic Data for Generative Modeling across Domains
Miruna Cretu, Alex Abrudan, Antonia Panescu, Tynan Perez, Rishabh Anand, N. Benjamin Erichson, Michael W. Mahoney, Samuel Blau, Joseph Jacobson, Rafael Gómez-Bombarelli, Rex Ying, Tuomas Knowles, Pietro Liò, Alex Morehead
cs.LG, cs.AI
2026-10-08
单一原子级模型 Zatom-2 在约 500 万条 DFT 结构上多任务预训练,统一分子、材料与蛋白质生成,小数据蛋白质设计性 67.8%→74.8%。
原子级 3D 生成模型长期按领域分家:分子生成(EDM、TABASCO)、晶体生成(CDVAE、DiffCSP)、蛋白质生成(RFdiffusion3、BoltzGen)各用一套架构和输入表示,没有一个模型同时跨分子、周期性材料和生物大分子训练。这个分法没有物理必然性:分子、材料、蛋白质都是三维空间里相互作用的原子集合,决定结构的局部原子环境会在不同系统里反复出现。数据侧也早已备齐:OMol25 有超过 1 亿次高精度 DFT 计算,覆盖有机分子、金属配合物、电解质、过渡态;OMat24 约 1.18 亿次,覆盖无机材料,两者都带能量和力标签。缺的是把混合数据一起吃下去、还能把学到的东西迁移出去的单一模型。Zatom-2 回答的问题就是:大规模原子级数据该怎么用,才能学到跨任务、跨域的表示。
组织思想借自蛋白质侧:只生成坐标,原子身份从学到的几何表示里读出来,不对离散的原子类型单独建模。两套 tokenization 共用同一骨干:分子和材料用 atom1(一个原子一个 token),蛋白质沿用 atom14(每残基 14 个坐标槽位,氨基酸类型由序列头恢复)。
| 基准 | 指标 | Zatom-2 | 对照 |
| MP20(未弛豫) | MetaSUN 产率 | 4.92% | Crystalformer 3.1%,Zatom-1-L 0.64% |
| GEOM-Drugs | 有效性 | 96.90% | TABASCO 97.6%,Zatom-1 93.6% |
| GEOM-Drugs | PB-valid | 91.47% | TABASCO 91.6%,Zatom-1 94.1% |
QM9 有效性 95.72%,论文称已接近 SOTA。OMol25 训练分布的拟合(AFD 与平均受力)明显好于前代 Zatom-1。力条件可控性:生成结构的实际受力(用 UMA 评估)与条件值之间的 AUROC 在三个设置下为 0.76 到 1.00,MAE 0.69 到 0.93 eV/Å,档位区分可靠,档内精确匹配还做不到。
蛋白质迁移是最有信息量的实验,微调数据只有 2,000 个 SCOPe 结构域,评测做长度外推(129 到 256 残基):
| 初始化 | designability | 每序列成功率 | novelty |
| 从零训练 | 67.81% | 34.68% | 88.81% |
| 生成+结构预训练(无力条件) | 62.96% | 33.91% | 94.63% |
| 生成+结构+力/能量预训练 | 74.80% | 45.79% | 95.17% |
| RFdiffusion3(同 2k 数据) | 54.04% | 28.37% | 90.44% |
两个细节:完整生成+预测预训练比从零训练高 7 个百分点,每序列成功率高 11 个点;去掉力条件的预训练反而不如从零训练,说明迁移收益来自力感知,不是预训练本身。分布内(50 到 128 残基)RFdiffusion3 以 91.07% 领先 Zatom-2 最好的 89.68%,Zatom-2 赢的是低数据和外推场景。Scaling 上,同等 epoch 全量数据一致优于每域 50 万条子集,加参数再叠加收益,OMat24 结构预测受益最大。
这篇的价值主要在配方。单一原子级模型第一次同时覆盖分子生成、材料生成、结构预测和能量/力预测,并且证明量子化学预训练能迁移到数据稀缺的蛋白质生成。对做分子/材料生成的人,不强制等变的普通 Transformer 配多任务监督就能与专门架构打平甚至超过,MP20 未弛豫产率从 3.1% 提到 4.92% 是明显跳跃。对做蛋白质设计的人,先在小分子上学局部几何、再下到几千个结构域微调,给低数据场景提供了可操作的路线。代码、数据加载和训练配置全部开源。
作者自述:不保证严格旋转等变(靠数据增强),能量与力之间没有梯度一致性约束;作为非专门模型,MLIP 精度低于专门势函数;力的档内精确控制仍难。预训练只用了 OMol25 的 4M 切片(全量 1 亿+),scaling 结果本身就是作者对更大规模预训练的呼吁。
需要打折的地方:蛋白质实验域很窄,SCOPe-2k 只有 2,000 个不超过 128 残基的小结构域,评测上限 256 残基,离抗体、酶这类真实设计任务有距离;RFdiffusion3 对照是在同一份 2k 数据上训练的版本,不代表其全量预训练发布版的水平,分布内 Zatom-2 是输的。力条件在 ANI2x 上的 AUROC 只有 0.757,可控性跨域不一致。论文的 AI 使用声明披露生成式 AI 参与了文稿起草、代码与实验参数建议,数字结论以开源代码为准更稳妥。