2026-08-11
作者发现蛋白 NMR 谱里缺失的残基信号其实是毫秒动态的指纹,据此用 ESM-3 训出 Dyna-1,能预测酶催化和配体结合相关的运动。
蛋白质不是刚性的雕像,它要在多种构象之间来回切换才能干活。酶催化、配体结合、信号传导,背后都是微秒到毫秒(µs–ms)尺度的构象运动。但这些运动极难测。核磁共振(NMR)是少数能量化 µs–ms 动态的实验手段,可它出数慢、数据散、没有统一基准,全库拢共也就一百来套像样的弛豫数据。AlphaFold 把静态结构预测拉到几乎免费的程度,「蛋白质在动」这件事却基本还停在手工测量。
线索反而在数据缺失里。BMRB 数据库里近一万条蛋白的化学位移记录,普遍有一批残基没被赋值,也就是 NMR 谱上测不到信号。这通常被当成数据噪声或技术缺失随手忽略掉。作者提出一个大胆假设:这些残基不是测不到,而是它们正在经历 µs–ms 运动,信号被交换展宽(exchange broadening)抹平了。缺失本身就是动态的痕迹。
核心做法两步:
最好的那个模型叫 Dyna-1,特征来自蛋白语言模型 ESM-3 的某一层中间表征。ESM-3 是 EvolutionaryScale 那套把序列、结构、功能一起编码的多模态蛋白模型,用它的内部表征等于免费带上了进化与结构先验,不必从零学起。作者把一百多套实测 NMR 弛豫数据和 BMRB 的化学位移库整合成统一数据集,这是模型能落地的地基。
摘要给的是定性结论。精确指标(相关系数、AUC、对照基线)在付费墙后的正文里,本次没取到。
| 项 | 结论 |
| 训练目标 | 预测残基是否缺失化学位移赋值 |
| 间接验证 | 预测结果同时匹配 NMR 弛豫测得的 µs–ms 交换 |
| 表现最好的场景 | 直接关系生物功能的运动:酶催化位点、配体结合位点 |
| 生物学旁证 | 经历 µs–ms 交换的残基,在进化上更保守 |
关键的验证落在逻辑链上,不是单个「预测准确率」数字:模型本来只学「哪个残基在谱上缺了」,但它学到的东西恰好对得上实验测到的真实运动,而且专挑催化、结合这些蛋白质真正在干活的位点准。这种从代理标签一路打通到实验量的表现,说明缺信号确实捕捉到了动态本身,不是统计假象。
对做蛋白结构与药物设计的人,Dyna-1 把一件原本要专人在 NMR 谱仪前熬很久的事,降到了「给一段序列」的量级。酶的催化残基、靶点的结合口袋,这些恰恰是药物最关心的位置,也是动态最关键的位置,过去恰恰最难预测。它也示范了一个可复制的套路:数据缺失本身可以当标签,语言模型的内部表征可以直接迁移到稀缺的实验量上,这条思路对其它「数据贵、缺失多」的生物测量大概率也成立。
AlphaFold 解决了静态结构之后,「结构怎么动」是结构生物学当前最大的开放问题之一。Dyna-1 没有把它解掉,但给出了一条能规模化、能对接已有蛋白模型的路径。