2026-08-11
Caltech 团队用主动学习(多任务集成模型+期望超体积提升)指导 protoglobin 定向进化,只测 655 条序列就让每个亲本反应都出现更优突变,并催化出 5 类亲本做不到的新反应。
定向进化(directed evolution)是改造酶的主力方法,Arnold 实验室靠它拿了 2018 年诺贝尔化学奖。它的痛点在起点:必须先有一个对目标反应有「可测活性」的蛋白,才谈得上优化。找这个起点要筛海量突变库,命中率很低。
Arnold 团队此前做过 ALDE(active learning-assisted directed evolution,主动学习辅助定向进化):拿一个机器学习模型,边做实验边更新,让它反过来提议「下一步最该测哪些突变」。这篇把它推到多反应优化,叫 mr-ALDE(multi-reaction ALDE)。一个模型同时吃下好几种反应的数据,预测出对卡宾和氮宾两类转移反应都更活跃的突变,目标是得到一批「广谱」酶库,作为后续筛选的起点。
起点蛋白叫 PromPgb,一种耐热的 protoglobin(原血红蛋白),本来就能催化卡宾和氮宾两类转移反应。这是后面能成功的前提。
训练数据这么来:把活性位点的双点突变(152 条,8×19)和三点突变(264 条)拿去测 8 个初始训练反应(ITR),攒下超过 4000 对「序列到功能」数据、500 多条多点突变。
模型是一个多任务监督学习的集成,输入是序列编码,同时预测两个目标:卡宾活性均值、氮宾活性均值。挑下一条做实验的突变,用的是「期望超体积提升」(expected hypervolume improvement,EHVI)这个采集函数,在「预测分高」和「不确定性大」之间权衡,沿多目标的帕累托前沿推进。
跑两轮:第一轮模型提议 63 条突变,拿去测 14 个新反应加 ITR,共 22 个反应(13 个卡宾、9 个氮宾);把结果喂回模型,第二轮再提议 64 条,测这 22 个再加 4 个,一共 26 个反应。两轮合计 127 条模型预测的突变,算上训练库一共测了 655 条序列。
只要亲本能催化出可检测产物的反应,模型预测的库里至少都有一条突变比亲本更活跃。更关键的是,这种提升也出现在跟训练反应机理完全不同的反应上,说明模型学到的序列特征能外推。
最突出的例子是 N6 反应(烷基叠氮的分子内 C(sp³)−H 胺化):亲本只有痕量产物,而突变 FYIFMMFQ 给到 3% 产率。这条突变第一轮就出现,当时模型只见过 ITR 数据,而 N6 需要的叠氮活化加分子内环化两步,训练集里压根没有。
数量级上的对比更能看出模型的分量:训练库的突变里只有约 33% 能在某个 ITR 上超过亲本产率,而两轮预测库里将近 70% 的变体都能在至少一个反应上压过亲本。其他具体数字:反应 C13 上突变 VVFFMAFN 相对亲本提升 6 倍;针对抗血栓药替格瑞洛(ticagrelor)的环丙烷前体 trans-5,变体 VYIAIVFQ 给出 9:1 的 trans 选择性;变体 TAIFMVFQ 把 C8 反应的选择性整个翻转到 Z 产物。这一切只测了 655 条序列。
此外,亲本催化不了的 10 个反应里,有 5 个被这批突变库催化了出来。代价是:亲本的「本职」反应 N1,最好的突变也只能做到亲本产率的五分之一,说明广谱活性和本职功能之间有权衡。
定向进化最贵的是湿实验筛选。能用模型挑出值得做的突变,就把筛选量压下来了。这篇一次模型指导的实验只测 655 条序列就换来一批广谱催化剂,对药物合成和精细化工里找酶起点的人是实打实省事。
它也是一个被验证过的「主动学习做蛋白工程」案例,对搞 MLDE(机器学习指导进化)和自驱动实验室(self-driving lab)的人有参考价值。
作者自己点明:整篇只做了一个酶类(protoglobin),而且这个起点「位置特别好」,耐热、本来就同时催化卡宾和氮宾。没有一个这样的亲本,mr-ALDE 很难跑起来。实验室对 ApePgb 这一族还有大量先验知识,能挑准哪些活性位点突变会影响非天然反应、且带上位效应。换到先验知识少的体系上能不能成,还没验证;怎么最优地设计训练反应集、突变库和模型参数,作者也说目前不清楚。
读下来的存疑:这是一个精心挑过的骨架加厚实的生化先验,机器学习贡献了一部分,但实验设计和领域知识同样关键,增益能否迁移到更难、了解更少的酶上仍然开放。另外那些「新」反应产率并不高(N6 只有 3%),是「可测活性」,不是能直接上生产的催化剂。