排序学习配机器人闭环,五轮把两种酶活性提到 57 倍和 104 倍
2026-08-05
天津大学的 REAP 用「排序+回归」混合损失配机器人闭环定向进化酶,五轮把 P450 BM3 活性提到 57 倍、Sortase A 提到 104 倍。
这篇在解决什么
定向进化(反复突变加筛选,人为驱动酶获得想要的活性)有两个老问题。一是酶的适应度景观(fitness landscape,把每个突变变体映射到活性的高维曲面)崎岖又稀疏,一轮筛上千个变体大多是死胡同,而真正带来增益的突变往往远离催化活性中心,光盯着活性中心找不到。二是纯实验慢,一个循环几周;纯计算的预测模型又因为训练样本太少、只用标准回归损失学不准,在数据稀疏时「排第几」比「具体多少」更重要,而 MSE 这类损失恰恰在这点上吃亏。
方法
REAP 把三件事拧成一个闭环:蛋白语言模型当特征提取器、一个叫 RankReg 的混合损失、一套全自动湿实验机器人。
模型层:
- 先用 ESM2(蛋白语言模型)做零样本预测,从候选变体库里挑高优先级变体当初始训练集。P450 BM3 这一例挑了 32 个。
- PLM-RankReg 是核心。损失分两部分:逐点回归项预测活性绝对值,成对排序项约束「谁比谁高」。排序项分三种情形:活动差距大的正对用铰链罚(hinge)逼预测间隔超过自适应边距;负对对称处理;活动接近时用二次罚保持细粒度一致性。数据稀疏时模型先把顺序学对,再收敛到准确数值。
- 推断用 100 个神经网络集成,输出均值 μ 和标准差 σ。采样走贝叶斯主动学习:优先挑高活性(开发)或高不确定(探索)的变体去实验,把有限筛选预算花在模型最没把握的地方。
机器人层是四段流水线:建库(约 3 天)、蛋白表达(约 2 天)、裂解与酶反应(约 1 天)、功能检测(约 1 小时),全程在 Tecan Fluent 上自动跑,不靠人介入。检测端 P450 BM3 用 Echo-MS 量化产物,Sortase A 用荧光去猝灭。12 次重复实验两两 Pearson 相关都超过 0.98,粗提液与纯化蛋白活性相关性 R≈0.96,高通量筛的数能信。
每轮结果回灌模型,下一轮的突变建议从单点逐步扩到组合突变。
结果
P450 BM3(细胞色素 P450,这例催化 (−)-脱氧鬼臼毒素的羟化,鬼臼毒素是抗癌药前体):
- 以 FL#62 变体为起点跑 5 轮。前三轮筛单点突变(第一轮 93 个),第四轮双点,第五轮四点。
- 模型提名 27 个位点,加 13 个功能相关位点共 40 个;网络分析锁定 A330E、S81M、T180L、E207L、R498V 等关键突变,含这些位点的四点变体排进第五轮前三。
- 5 轮内目标活性提升 57 倍。
Sortase A(金黄色葡萄球菌转肽酶,用于蛋白偶联):
- 同一套闭环,目标活性提升最高 104 倍。
- 一个值得展开的发现:D170Q 单点时活性不如 D185V 和 D185T,但在四点突变背景下反而更强。这种上下文依赖的上位效应(epistasis,组合效应不等于单点效应之和)正是逐点筛会漏掉的,模型靠组合采样抓到了。
模型对照基准(五折交叉验证,用 Spearman 相关衡量排序能力):
| 损失/模型 | 排序能力 | 单点→组合外推 |
| PLM-RankReg | 基准 | 基准 |
| EVOLVEpro | 显著更差(P=3.6×10⁻⁶) | 显著更差(P=1.4×10⁻⁴) |
| MSE / L1 | 显著更差 | 显著更差 |
| HuberLoss | 显著更差(排序) | 未达显著(P=0.076) |
排序能力上全面领先;外推到组合空间时,对 HuberLoss 的优势不明显。
为什么重要
把推荐系统里成熟的排序学习(关心相对序而非绝对值)搬进蛋白工程,恰好对症定向进化的稀疏数据。配合自动化湿实验,REAP 把一个工程循环压到周量级,且每轮都让模型变强。对做合成生物学和绿色化学(用酶替代金属催化剂合成药物分子)的人,这是 AI 真正接上实验、而不是停在预测层面的工作范例。
局限与存疑
- 只在两种酶上验证,且都是相对好建模的体系;对底物特异性极窄或活性景观更崎岖的酶类,泛化能力还没有证据。
- 闭环依赖一整套自动化湿实验平台(机械臂、Echo-MS),普通实验室复现不了,所谓「可推广」现阶段对设备门槛并不敏感。
- 57 倍和 104 倍是高通量粗筛口径的目标活性(desired activity),不是纯化酶的动力学常数。作者对代表变体补了动力学表征,但头条倍数仍是筛选口径。
- 初始训练集靠 ESM2 零样本挑选,需要一个过得去的起点变体(FL#62)和靠谱的蛋白语言模型;完全冷启动的场景没测。
- 单点→组合外推上,对 HuberLoss 没拉开显著差距,说明这条改进路线在更稳的回归损失面前优势会收窄。
术语
- 定向进化 (directed evolution):反复突变加筛选、人为驱动酶获得想要活性的实验方法,2018 年诺贝尔化学奖方向。
- 适应度景观 (fitness landscape):把每个变体映射到其活性的高维曲面;崎岖意味着小突变带来大活性波动。
- 蛋白语言模型 (PLM, ESM2):在大规模蛋白序列上自监督训练的模型,输出可作突变功能预测的特征,也能零样本打分变体。
- RankReg:本文提出的混合损失,回归项管绝对值、排序项管相对序。
- 贝叶斯主动学习 (Bayesian active learning):用集成模型的预测不确定性(σ)主动挑最该做的实验,平衡开发与探索。
- 上位效应 (epistasis):一个突变的影响取决于其它位点是否也突变,组合效应不等于单点效应之和。
原文与代码
社区讨论
全部论文解读