RegimeFormer给2.03亿蛋白标扰动坐标,DMS上打平最优监督模型

2026-09-01

NTU与牛津等机构训练RegimeFormer,把2.03亿蛋白编入扰动坐标,并在99.6万条序列上写出4.07亿残基脆弱度。217项替换实验Spearman达0.698,与最优监督模型0.700几乎打平。

这篇在解决什么

蛋白质语言模型已经能从序列里估计单点突变的效果,深度突变扫描(DMS)也能把单个蛋白的替换景观测得很密。两边都卡在覆盖率:公开序列已经到两亿量级,实验室一次通常只扫一个蛋白。现有工具给出的是「这个位点换成这个氨基酸会怎样」,缺一张跨家族、跨物种的全局坐标,用来解释同一类扰动为什么在一个蛋白里被容忍、在另一个蛋白里毁掉功能。

RegimeFormer 要补的就是这张坐标。它把每个蛋白放进一条从脆弱(fragile)到可适应(adaptive)的连续轴上,再把这条轴当作先验,去做残基级和替换级预测。

方法

数据层叫 RegimeAtlas。从 UniProtKB、RefSeq、Ensembl、MGnify 等来源汇集 4.25 亿条原始记录,经过字母表、最短 30 个氨基酸、低复杂度和 90% 同一性近重复聚类,留下 2.0256 亿条非冗余蛋白,占原始集合的 47.7%。全部用 ESM 家族编码器做蛋白级嵌入并投影到扰动坐标。高分辨率训练与推理只用多样性保留的 100 万条子集,其中 995,995 条通过残基扫描,覆盖 4.0705 亿个残基。骨干是 ESM2 t33 650M,流式窗口最长 1,022 个残基,算力是 32 张 A100,大约五个月。

对每个残基和候选突变氨基酸,模型拼接六类输入:残基 PLM 表示、野生型与突变氨基酸嵌入、蛋白级扰动坐标、实验上下文,以及可选的结构或进化特征。这些量投影到同一潜空间,经过六个带扰动条件的注意力块。实验类型用 FiLM 适配器注入,扰动状态用软门控做混合。输出三个头:连续效应、预测标准差、损害/耐受/有益三分类。残基脆弱度取效应分布的有害尾,可适应度取有益或耐受尾,不确定性把替换级标准差聚起来。

全量 L×19 替换矩阵不落盘,按需查询。相对存齐所有矩阵,部署后的摘要加索引大约只占 0.35%。这是工程选择,不是精度妥协:按需查询与离线参考的 Pearson 和 Spearman 都是 0.997。

结果

扰动坐标不是分类学的换皮。在 24,918 条带完整协变量的蛋白上,坐标与分类学的调整互信息只有 0.0063。PLM 特征预测坐标的平衡准确率比分类学加长度加 Pfam 高出 0.331。真实坐标与下游扰动读数的平均绝对 Spearman 为 0.38,比长度、打乱嵌入、氨基酸组成等对照高 0.08–0.11。

残基级对照更硬。高脆弱残基在活性位点的优势比 11.3,配体结合位点 6.1,界面 3.2,致病错义位点 4.0。突变敏感度沿坐标单调下降,Pearson r 为 −0.71。已有预测器的误差也沿这条轴走:ESM-650M 从脆弱到可适应的平均绝对误差差 1.38。用坐标加元数据预报「哪家预测器会在哪出错」,AUROC 达到 0.861。

替换级主结果如下。

设置指标RegimeFormer对照
217 项替换实验Spearman ρ0.698AUTOSCIENTISTS 0.700;Kermut 0.662
完整模型替换 Spearman0.723去掉突变氨基酸嵌入 0.548;仅 PLM 0.579;去掉坐标 0.701
未见蛋白/家族/低于 30% 同源保留比例约 82%/62%/38%低同源区相对 PLM 基线的优势最大
5% 筛选预算HitRate0.540最强基线 0.434
PRISM 药物响应随机划分 0.833未见化合物 0.038

与 Kermut 在 87 个蛋白上配对,81 个赢,平均增益 +0.036。时间外推几乎不掉,从 0.591 到 0.585。结构侧与 AlphaFold pLDDT 的 Spearman 是 0.375;进化侧 phyloP 是 0.5895。细胞侧把蛋白先验送进 SciPlex3,Pearson 从 txPert/GEARS 的 0.253 到 0.294,RMSE 几乎不动。

为什么重要

对做突变效应预测和蛋白工程的人,这篇的增量不在榜单第一名。坐标在分布内只把 Spearman 从 0.701 提到 0.723,但低同源、未见家族、小样本实验上贡献更大。5% 预算下比最强基线多找回约 24% 的有益突变。工程上只存残基摘要、按需算替换,才让两亿级图谱可查询。

细胞和药物那一段更像附加演示。蛋白先验能过细胞系外推(未见细胞系 R² 仍有 0.746),过不了化学结构外推。适合拿来排实验优先级、看已有预测器在哪会翻车。不适合当成未见小分子的药效模型。

局限与存疑

作者自己划出了几条硬边界。序列长于 1,000 残基时扫描成功率仍高于 99%,长于 10,000 时掉到 83.4%。未见化合物划分上 R² 只有 0.038,Pearson 0.222,论文把它单独标成失败区。低同源只保住分布内替换性能的约 38%。

另外几处论文写得满、证据没那么满。217 项实验上 0.698 相对 AUTOSCIENTISTS 的 0.700 是持平。去掉扰动坐标只掉 0.022,分布内的大头仍是突变氨基酸身份。专家效用实验是界面上多给坐标和虚拟 DMS,HitRate@20 从 0.29 到 0.41,不是对四亿残基虚拟图的湿实验验证。代码可用性只写「材料里保留分析环境与 checkpoint」,正文没有公开仓库地址。这是 bioRxiv 预印本,尚未同行评审。两亿条是蛋白级坐标,残基扫描实际是 100 万条子集;把这两层说成同一张全序列宇宙突变图,会夸大分辨率。

术语

原文与代码

社区讨论

全部论文解读