排序学习配机器人闭环,五轮把两种酶活性提到 57 倍和 104 倍

2026-08-05

天津大学的 REAP 用「排序+回归」混合损失配机器人闭环定向进化酶,五轮把 P450 BM3 活性提到 57 倍、Sortase A 提到 104 倍。

这篇在解决什么

定向进化(反复突变加筛选,人为驱动酶获得想要的活性)有两个老问题。一是酶的适应度景观(fitness landscape,把每个突变变体映射到活性的高维曲面)崎岖又稀疏,一轮筛上千个变体大多是死胡同,而真正带来增益的突变往往远离催化活性中心,光盯着活性中心找不到。二是纯实验慢,一个循环几周;纯计算的预测模型又因为训练样本太少、只用标准回归损失学不准,在数据稀疏时「排第几」比「具体多少」更重要,而 MSE 这类损失恰恰在这点上吃亏。

方法

REAP 把三件事拧成一个闭环:蛋白语言模型当特征提取器、一个叫 RankReg 的混合损失、一套全自动湿实验机器人。

模型层:

机器人层是四段流水线:建库(约 3 天)、蛋白表达(约 2 天)、裂解与酶反应(约 1 天)、功能检测(约 1 小时),全程在 Tecan Fluent 上自动跑,不靠人介入。检测端 P450 BM3 用 Echo-MS 量化产物,Sortase A 用荧光去猝灭。12 次重复实验两两 Pearson 相关都超过 0.98,粗提液与纯化蛋白活性相关性 R≈0.96,高通量筛的数能信。

每轮结果回灌模型,下一轮的突变建议从单点逐步扩到组合突变。

结果

P450 BM3(细胞色素 P450,这例催化 (−)-脱氧鬼臼毒素的羟化,鬼臼毒素是抗癌药前体):

Sortase A(金黄色葡萄球菌转肽酶,用于蛋白偶联):

模型对照基准(五折交叉验证,用 Spearman 相关衡量排序能力):

损失/模型排序能力单点→组合外推
PLM-RankReg基准基准
EVOLVEpro显著更差(P=3.6×10⁻⁶)显著更差(P=1.4×10⁻⁴)
MSE / L1显著更差显著更差
HuberLoss显著更差(排序)未达显著(P=0.076)

排序能力上全面领先;外推到组合空间时,对 HuberLoss 的优势不明显。

为什么重要

把推荐系统里成熟的排序学习(关心相对序而非绝对值)搬进蛋白工程,恰好对症定向进化的稀疏数据。配合自动化湿实验,REAP 把一个工程循环压到周量级,且每轮都让模型变强。对做合成生物学和绿色化学(用酶替代金属催化剂合成药物分子)的人,这是 AI 真正接上实验、而不是停在预测层面的工作范例。

局限与存疑

术语

原文与代码

社区讨论

全部论文解读