筛120个变体远红蛋白亮4.35倍,到哺乳细胞里反而更暗

2026-08-29

筛120个变体远红蛋白亮4.35倍,同一突变在HEK293T里比亲本暗3.6到4.1倍。

这篇在解决什么

常规GFP发蓝绿光,组织散射和吸收都很重。miRFPnano这类从细菌光敏色素改出来的远红蛋白,激发发射都在组织窗口里,但亮度差一截。传统定向进化要筛巨大随机库,通量不够时几乎做不动。

主动学习定向进化(ALDE)把模型和实验做成闭环:每轮用已有序列-功能数据训练代理模型,再挑下一轮最该测的序列。这篇把这套流程接到纳升级无细胞表达上,对象是miRFP670nano3。

方法

代理模型选了高斯过程,输入是ESM3 embedding做均值池化、列标准化,再PCA压到3维。九份DMS数据上不同代理的最终最优适应度没有显著差异(Friedman p=0.32),GP留下是因为它能给贝叶斯优化用的后验不确定性。

实验侧用PURExpress无细胞体系,直接从线性DNA表达,补5 μM胆绿素,N端HiBiT定量表达量。标签是加权活性:75%亮度、25%表达,都对亲本归一。设计空间是单点饱和突变,初始化24个变体:12个embedding k-means质心附近,12个HotSpot Wizard认为耐受的位点。五轮共120个变体。1–3轮测单突变,超过亲本的再在4–5轮做三突变组合。

回顾模拟在ProteinGym的九份DMS上跑,固定总预算384次,batch从一次384扫到47次每次8个。冷启动先验试了ESM-2 masked-marginal(pMMS)和ESM-IF1 inverse folding,外加打乱负对照。

结果

120个变体里74个加权活性与亲本显著不同,12个亮度超过两倍,最好的K6G-L50F-A143T亮4.35倍,表达掉25%。靠近胆绿素结合位点的突变一律有害,包括打断共价连接的C86A。pMMS和实测亮度几乎不相关(Spearman ρ=0.098, p=0.286)。

关键打脸在细胞里。HEK293T瞬时转染,亲本的远红geoMFI比三个工程变体高3.6到4.1倍(ANOVA p=2.0×10^{-6})。慢病毒稳定株和滴定实验方向相同。细菌纯化蛋白上K6G-L50F-A143T和I130C-V138I-Q145K仍比亲本亮(ANOVA p=0.0011),消光系数和量子产率没变,热稳定性下降。

模拟侧,更小更勤的batch让累积平均适应度收敛更快(九份数据组内Spearman ρ=−0.927, p=0.0039);对最终最优变体效应较弱(ρ=−0.524, p=0.0195)。作者建议48–96个/批作为折中。零样本先验只在它和真实适应度相关时有用,相关越强,累积regret降得越多(8/9份数据为正,ρ=0.652)。对miRFP670nano3,pMMS几乎没信息。

为什么重要

蛋白工程里「模型闭环+小通量实验」能在120次测量里找到结构看不出来的突变。同时给了一条很硬的警告:无细胞、胆绿素饱和条件下选出来的变体,到哺乳细胞里可以完全反过来。胆绿素在PURExpress里是5 μM饱和,哺乳细胞补25 μM还过膜差、血清里会被抑制。突变没改发色团光物理,更像提高了折叠并装上辅因子的比例,辅因子一缺就崩。

对做AI4Science的人,batch宜小、先验要按置信度加权,这两条比换代理模型更要紧。九份DMS上模型类别几乎分不出高下。

局限与存疑

模型对held-out位点泛化很差,均值池化加三维PCA很可能把功能信号挤掉了。搜索空间限制在单点,结合口袋的组合突变没做。哺乳细胞验证放在全部五轮之后,每轮若同步测细胞,走偏会早发现。热稳定性下降,光谱没变,工程价值主要停在细菌和无细胞体系。bioRxiv预印本,未经同行评审。

术语

原文与代码

社区讨论

全部论文解读