2026-07-29
MIT 等用结构感知模型 ESM-IF1 定向进化烟草 Rubisco,最佳单点突变把空气中羧化效率提升 43%,且能正确组装进叶绿体。
地球上大部分生物量都靠 Rubisco 这一种酶固定下来。它把空气里的二氧化碳变成糖,是光合作用的核心,也占掉了叶片可溶蛋白的两到五成。问题在于它又慢又笨,还会误把氧气当底物,白白浪费能量。Rubisco 一直是改造作物产量的头号目标,但它极难工程化:组装需要好几种专属伴侣蛋白,而且陆生植物的 Rubisco 序列保守到几乎没有可改造的余地,随机诱变扫到的多半是有害突变。
能不能用机器学习替我们把那一小撮「自然进化没试过、但确实有用」的位点找出来?这是这篇要回答的。
团队拿 ESM-IF1 这种结构感知的蛋白质语言模型当筛选器。和只读序列的模型不同,ESM-IF1 是在约 1200 万个 AlphaFold2 预测结构上训练的逆折叠模型,它看的是三维结构对应的生物物理规律,而不是「自然界刚好出现过什么」。
做法分几步:
挑结构模型而非序列模型,是因为植物 Rubisco 序列太保守,纯序列模型(ESM-1bv)只会推荐自然界已有的东西;挑饱和诱变而非随机,既把库压到极小,又能拿到那些需要密码子双突变、单轮易错 PCR 抓不到的替换,比如 A438R。
筛选效率是最亮眼的数字。库的阳性富集率 16%,比之前用易错 PCR 随机库(50 万个变体里捞到 46 个)高出 1700 倍。机器学习的收益不是让命中率翻倍,而是把需要筛的库缩小了三个数量级。
动力学上,最佳单点变体 T391I 把羧化速率(kcat)提高了 29%,空气中的羧化效率(kcat/KC)提高了 43%,而且没有牺牲 CO2 与 O2 的专一性。
| 变体 | 关键变化 | 羧化效率提升 |
| T391I | 羧化速率 +29% | +43% |
| I465V | CO2 亲和力改善 | +32% |
| A438R | CO2 亲和力改善 | +15% |
19 个被富集的变体里,7 个是真的因催化变好而长得更好,不是单纯可溶性变高。把多个好突变叠在一起没用:5 连突变还略逊于 T391I 单点,10 连和 20 连根本长不出来,折叠坏了。
还有一点值得拎出来:好几个改进变体(包括 T391I)携带的替换在植物进化谱系里要么罕见要么没有,而它们依然能在真实叶绿体里正确组装(团队在转基因本氏烟草里验证过)。植物 Rubisco 并没有进化到头,自然没采样的序列空间里有真货。
这是目前结构感知机器学习在 Rubisco,也就是光合作用里最难啃的保守酶上拿到的最成功的结果,而且突破了自然多样性设的天花板。如果在体外测到的动力学生物学增益能搬到整株植物上,它指向的是一条提升作物光合效率的现实路径。更普遍地说,它证明了「机器学习点穴 + 饱和诱变 + 体内筛选」这套配方对随机诱变啃不动的保守酶是有效的。
作者自己说得很清楚。ESM-IF1 并不总能精准命中每个位点上的最佳替换:它推荐的是 T391R(筛选没富集),真正拔尖的 T391I 是靠饱和诱变补出来的。也就是说机器学习指对了穴位,但最终那一下还得靠实验筛。无监督模型还看不到蛋白互作:像 R89P、K94E 这种推荐会破坏 Rubisco 和激活酶(Rca)的结合,在整株植物里可能有害,得靠有监督模型或人工剔除。
最大的存疑是落地。这些增益是在大肠杆菌和体外测的。在真实叶绿体里,Rubisco 含量下降、副产物增多、激活态降低这些因素可能把增益吃掉。团队还需要把稳定的转基因烟草做出来,才能回答整株光合到底涨没涨。