蛋白语言模型 ESM-1v 排斥改变特异性的突变,两模型相减可富集 4 倍

2026-08-02

哈佛团队发现 ESM-1v 等蛋白语言模型会系统性地给「改变底物特异性」的突变打低分,据此做定向进化设计反不如随机抽样;改用两个模型的分数相减,富集可提到约 4 倍。

这篇在解决什么

定向进化想要改造蛋白质去做它天然不会做的事:让一种酶改吃另一种底物,让一个转录因子改认另一段 DNA,让一个转运蛋白改运另一种离子。可能的氨基酸组合是天文数字,实验能测的只是九牛一毛,所以现在流行用机器学习来挑值得测的突变。

过去几年一类「无监督蛋白适应度模型」成了主力:把已知天然蛋白序列喂给模型,它学到的就是「自然里能留下来的序列大概长什么样」,然后拿这个分布给突变打分。蛋白质语言模型(ESM-1v 这类)是其中最被寄予厚望的一支,不少研究默认它们学到了某种「通用的蛋白适应度」,因此能用来引导定向进化,甚至引导出和天然功能不同的新功能。

这个默认假设其实从没被系统检验过。已有的评测(比如 ProteinGym 排行榜)测的是模型预测「蛋白本来那个功能」受突变影响的能力,不是预测「换了个功能」的能力。哈佛的 Berry、Gaudet 和 Marks 这篇就是来填这个坑的。

方法

作者建了一个叫 SpecificityStudio 的数据库,作为 ProteinGym 的补充。核心是 8 个「多重功能测定」数据集,每个都在同一批突变上测了蛋白对多个不同底物或配体的活性:有结合结构域(PSD95-PDZ3)、三种酶(TEM-1、AmiE、PafA)、两个转录因子(Pho4、RamR)、两个转运蛋白(NorA、DraNramp)。每个突变按表现分成三类:彻底失活、保持天然特异性、改变了特异性。

然后用 14 个零样本适应度模型给所有突变打分,分属 6 类:位点独立的保守度模型(PSSM)、基于序列比对的协变模型(EVmutation、EVE、GEMME)、单序列蛋白质语言模型(ESM-1v、ESM-2、ProGen2、Tranception)、混合模型(MSA Transformer、PoET、SaProt)、逆折叠模型(ESM-IF1、ProteinMPNN)。

衡量偏置用了一个自定义指标 ASI(altered-specificity index,改变了特异性的指数)。它把模型给「改变特异性」突变的平均分,放在「天然特异性」和「失活」两者的平均分之间做归一:ASI 等于 1 表示模型对改变特异性没有歧视,等于 0 表示模型把改变特异性的突变当成失活一样打低分。作者还模拟「只挑模型打分最高的前 5% 突变去合成」,看里面改变特异性的突变比随机抽样多出多少倍。

关键的招数在最后。既然不同模型给分差异很大,这个差异本身就藏着和特异性有关的信息。作者用逻辑回归给两个模型的分数做加权,实测下来最优权重总是负的或零:该用两个分数相减,不该相加。

结果

先确认一件不意外的事:所有模型都能把失活突变和天然活性突变分开,这是它们的基本功。ProteinMPNN 除外,它在多数数据集上表现太差被剔除了。

真正的发现在改变特异性这边。ASI 显示,越依赖序列上下文的模型,越倾向于给改变特异性的突变打低分。蛋白质语言模型(ESM-1v、ESM-2、ProGen2、Tranception)和深度协变模型(EVE、MSA Transformer)ASI 最低,几乎把改变特异性的突变当成失活突变。只有完全不看上下文、逐列独立统计的 PSSM,ASI 接近 1,对天然和改变特异性一视同仁。逆折叠模型 ESM-IF1 表现也接近 PSSM。混合模型(PoET、SaProt、ESCOTT)和浅协变(EVmutation、GEMME)居中。

这个偏置直接体现在设计上:

模型类别改变特异性突变的富集(对随机)
蛋白质语言模型(ESM-1v、ProGen2、Tranception)多个数据集上 top 5% 里一个改变特异性的突变都没有
深度协变模型(EVE、GEMME、ESCOTT)同样在多个数据集上为零
逆折叠模型略好于随机,但很不稳定
PSSM(位点独立)因数据集而异:RamR 上超过 4 倍,DraNramp 上远低于随机;平均接近中性

没有任何一个单独模型能给出超过 2 倍的平均富集。把现在最流行的蛋白质语言模型直接拿去引导「换功能」的定向进化,结果很可能比闭着眼随机挑突变还差。

加权差的效果要好得多:

做法top 5% 改变特异性富集
单独任一模型< 2 倍
PSSM 与 ESM-1v 加权差(全部数据集)2.5 倍
只在「引入全新非天然底物」一类(Class 1)上拟合,逐个留一验证4 倍

收益最大的是 DraNramp,唯一一个野生型对非天然底物完全没活性的例子。作者据此判断:模型间的差,对「大幅偏离野生型功能」的设计最有用,对微调已有底物之间的相对偏好帮助不大。

为什么重要

这篇的结论是一个测量学警告,不是新模型。它戳破了一个被广泛传播的假设:蛋白质语言模型学到了「通用蛋白适应度」,所以能引导出全新功能。事实更接近反面,它们学的是「天然序列分布本身」,而这个分布是自然进化这个非平衡过程留下的偏置样本。越会利用上下文、越深地拟合这个分布的模型,对没被自然采样过的功能区域排斥得越狠。

对从业者,这有两层意思。第一,ProteinGym 上分数高、预测天然功能准的模型,不等于预测改变功能也准,两者常常是反相关的。想工程化一个新功能,位点独立的保守度模型往往比最先进的语言模型更靠谱;语言模型更适合用来强化一个蛋白已经被自然选择的那个功能。第二,既然这个偏置是系统性的,它本身可以被利用:模型给分的差异里就编码了特异性信息。作者用一句比喻收尾,一个选择题全做错的学生,说明他其实知道一些答案。从 ESM-1v 的分数里减掉一些,等于把「它知道不该往哪走」翻转成「该往哪走」。

局限与存疑

作者自己最看重的一个局限:数据库太小也太杂,只有 8 个数据集。原因是绝大多数突变扫描实验一次只测一个底物。他们承认加权差只是「地板」不是「天花板」,更多定量、大规模的数据出来后上限会高得多,而且写稿期间就有两篇相关工作出现。

还有几个没验证透的点。第一,所有模型都是零样本的,只看序列(顶多加个静态结构),完全没有用到「到底换成了哪个底物或配体」这个信息。要做到真正预测某个具体新活性、而不只是富集一批「大概有变化的」突变,必须把配体本身喂进模型,这篇还没到那一步。第二,改变特异性的标签在不同数据集上定义不一样(有的是线性回归找离群,有的靠全局上位性模型),数据集之间的结论有相当大的异质性,作者也承认 Class 2 那几例趋势并不清晰。第三,抗体这类演化过程更随机的蛋白被有意排除了,所以结论不能直接外推到抗体-抗原设计,而那恰恰是 ESM 类模型据报「设计新功能」成功的主要场景。作者把这个差别归因于抗体的演化更随机,但文中没有直接拿抗体做对照验证。

术语

原文与代码

社区讨论

全部论文解读