29家机构511条AI抗体盲测,簇内排序多数输给随机挑

2026-08-21

Nature Biotechnology用SARS-CoV-2 RBD做CASP式盲测:29家机构提交511条AI抗体。亲和力成熟能做出可开发的94.7pM分子,但簇内排序几乎全面输给随机挑选。

这篇在解决什么

计算抗体设计这两年论文很多,但绝大多数是事后复盘:作者拿已经公开的序列和亲和力对模型打分。没有盲测,也没有统一的湿实验,很难判断到底是方法进步还是过拟合公开集。

AIntibody按CASP的思路做了一轮前瞻盲测。29家机构提交511条序列,组织方按统一流程合成全长IgG,用高通量SPR、正交KinExA和五项可开发性实验打分。抗原故意选了数据最肥的SARS-CoV-2 RBD,作者自己说这是给AI最好的发挥条件,结果应看成该类靶点的上限,不是任意抗原的通解。

方法

三项任务对应发现管线里三步:

测序数据以scFv格式产生,提交序列一律表达成全长IgG。可开发性五项打分,累计≤3过关、≥4淘汰。SPR与单点KinExA的Spearman ρ为0.94,两套亲和力平台排序基本一致。

参赛方法被归成四类:统计启发式、经典机器学习、带注意力或预训练蛋白语言模型、显式三维结构方法。赢家多把蛋白语言模型和结构模型绑在一起。

结果

任务1是AI最站得住的场景。约13%的提交相对亲本实现了≥20倍亲和力提升(到<10 nM)。Aureka的AuraBind(结构感知pairformer加DPO)做出6条可开发、<10 nM的抗体,其中一条94.7 pM,和实验最佳113 pM统计上打平。另有6家至少做出一条可开发的<10 nM分子,8家一条可开发结合剂都没有。一个完全不用AI的共识序列方法做到538 pM,离头部不远。任务1约25家参与、119条提交。

任务2是这篇最刺耳的数字。除华盛顿大学一组外,所有AI预测策略都不如随机挑克隆:AI提交里只有9.8%–13.8%优于簇对照,随机挑选是39%。即便是各簇赢家,多数也只有11%–25%优于对照,过不了随机基线。策略还不跨簇:没有一家在三个HCDR3簇上同时赢。簇27F的58条提交里98.3%能结合RBD,24.1%达到亚100 pM,但可开发性强烈绑在HCDR3本身。

任务3更散。23家168条提交中,69.6%结合RBD,30.4%不结合;14.3%达到亚100 pM,71.4%通过可开发性,同时满足结合且可开发的占53.6%。Xencor用微调抗体语言模型加注意力池化,做出2.9 pM的赢家。但非结合剂明显多于实验抗体,高亲和池里可开发性掉得更快。头部序列相对给定数据的CDR编辑距离大多只有1–5,所有头部提交都复用了实验数据里已有的HCDR3。

为什么重要

对做分子设计的人,这是一张比宣传稿冷静的地图:在亲和力成熟、突变空间被测序数据圈住时,头部模型已经能省下2–3周组合库实验。一旦任务变成「在簇里找出更好的克隆」或「设计库外新CDR」,多数模型会帮倒忙。随机挑加最丰度克隆,在任务2里比大多数深度学习管线更安全。

跨任务迁移几乎不存在。Aureka赢了任务1,同一套算法在任务2、3并没有同样统治力。没有通吃的抗体AI。

局限与存疑

作者写得很清楚:只测了一个抗原,组织方和写论文的是同一批人,盲法靠诚信而不是信息学隔离。任务2、3还提供了大量后期才有的亲和力标签,不像真实发现早期。可开发性用累计分,单项翻车能被别项拉回来,作者自己把这标成计分漏洞。赢家方法细节多数在补充材料,主文对失败模式的算法归因有限。SARS-CoV-2 RBD是被研究到滥的靶,换一个冷抗原,这些命中率大概率再往下掉。

术语

原文与代码

社区讨论

全部论文解读