Weissman组筛5万病毒微蛋白,钉死EBV小蛋白模仿PKA促癌

2026-08-27

Weissman与Mann组从5.3万病毒小ORF漏斗筛出超2000个活性微蛋白,用Perturb-seq、质谱和AlphaFold 3解析功能,并钉死EBV BNLF2b靠模仿宿主PKA抑制剂促上皮增殖。

这篇在解决什么

病毒基因组又密又乱:重叠读框、非ATG起始、程序性移码,标准注释管线经常漏掉编码序列。核糖体图谱已经在疱疹病毒、流感、SARS-CoV-2、HIV上扫出成千上万个非经典开放读框(ncORF),但绝大多数不知道能不能变成有功能的微蛋白(microprotein,通常短于120个氨基酸)。

HIV的15个注释基因里有7个编码微蛋白,SARS-CoV-2的29个蛋白里有10个是微蛋白。Vpu、Vpr这类短蛋白曾经带出tetherin、DCAF1这类宿主限制因子。整个人类感染病毒组里,这种短蛋白到底有多少、各干什么,一直没有一张功能图。Weissman、Mann、Elledge这几组用表型优先的漏斗,把这件事做成一张泛病毒图谱。

方法

从VirusHostDB里502条人类感染病毒基因组(38科、七类Baltimore分类)抽出全部带起始和终止密码子的小ORF。当时寡核苷酸合成上限是400 nt,所以只收短于121个氨基酸的序列。最终库52979条:注释序列1606条、未注释(不少于24 aa,ATG或CTG起始)47525条(占89.7%)、阴性对照3848条。注释条目里74%的UniProt标注分只有3分及以下,基本只知道序列本身。

过表达有毒ORF会在慢病毒包装阶段就掉库。他们做了pANDORA:Tet-On诱导、反义构型,基础漏表达极低。代价是滴度大约掉50倍,换来SARS-CoV-2 Nsp1这类毒蛋白能活着走到诱导后测量。

漏斗三层。第一层在K562和RPE-1做10天生长筛选,效应量至少偏离阴性对照两个标准差,拿到4329个初级命中(占库的8.2%)。第二层重合成4107条富集库(两边都毒、任一边促生长、全部注释基因),再筛一轮,FDR<0.05得到2028个命中。第三层补MHC-I表面表达、内质网应激存活、针对富集库的Perturb-seq、亲和富集质谱(AE-MS,约2304次运行),再用AlphaFold 3对高置信复合物(界面置信度ipTM>0.75)做结构提名,最后阵列验证。

Perturb-seq用10x Flex探针方案,在RPE-1上给3412条小ORF打转录表型。功能注释走连坐:转录距离加最小畸变嵌入聚类,再叠序列同源和文献。18个已知转录因子阳性对照全部通过能量距离检验且差异基因超过10个,阴性对照差异基因都少于5个。

结果

生长筛选的毒命中在两株细胞上相关(Pearson R=0.78),促生长几乎只在非转化的RPE-1出现。二次命中里70%仍未注释,55%与注释基因重叠,34%用非ATG起始。注释小ORF里58%(939/1606)根本没有生长表型,所以后面补了MHC-I和内质网应激。

读出规模命中
初级生长筛529794329(8.2%)
富集库生长筛41072028(FDR<0.05)
MHC-I表面8806748
内质网应激存活富集库602
Perturb-seq能量检验34121185(其中691条差异基因>10)

MHC-I命中有40%不进生长筛。已知TAP抑制剂HSV ICP47、EBV BNLF2a、牛痘CPXV012都回来了。抽5个只打MHC-I的候选做质谱,它们分别卡在合成(AKMV OPG024结合STAT1,AF3给出ipTM=0.78)、肽转运、内质网成熟、转运和降解,并没有挤在同一个宿主节点上。许多命中是两段式:跨膜螺旋负责定位,另一段短结构域或短线性基序负责干活。

Perturb-seq划出24个簇(433条)和752个孤点。簇里三种故事同时出现:同源同功能、非同源收敛、同源却分道。HPV E7和腺病毒E4 ORF6/7没有序列同源,却都绑Rb–E2F、把细胞赶进S期。另一簇把HIV Vpr、SARS-CoV-2 ORF6、猴痘MPXVgp154、YLDV132R和一个未注释的HMO星状病毒小ORF拉到一起:都压IFN-α/γ报告,机制是搅核质转运。AF3在ORF6、MPXVgp154、YLDV132R的C端看到接触Rae1货物口袋的残基,多序列比对抽出共享的DDXXMEID类短线性基序;把关键甲硫氨酸突成丙氨酸(ORF6 M58A、MPXVgp154 M69A、YLDV132R M75A)后,IFN抑制表型丢掉。Vpr对Rae1的预测很差(ipTM<0.4),它走的是importin这条线。

那个星状病毒小ORF套印在衣壳基因ORF2的+1框里,起始密码子距ORF2只有19 bp,近缘毒株没有这个起始,像是从头诞生。同一位点在别的星状病毒支上又长出序列和功能都不同的小ORF。

最硬的机制故事是EBV BNLF2b。它在RPE-1和正常口腔角质细胞里促增殖,还能在软琼脂上做锚定非依赖生长,E7能、其他促生长候选不能。质谱把PKA催化亚基PRKACA/PRKACB推到最前;它抑制PKA,宿主抑制剂PKIA过表达能复现生长优势。下游是MAPK:pERK和pMEK升高,RAS抑制剂RMC-7977或MEK抑制剂PD0325901选择性地抹掉BNLF2b和PKIA的适应度优势,不影响E7。AF3截去无序段后给出BNLF2b–PKA复合物(ipTM=0.79),BNLF2b坐进底物裂缝,带着模仿PKIA/PRKAR1A的RRNAL伪底物基序(对应RRXAI)和一段脯氨酸富集辅助基序。丙氨酸/赖氨酸扫描和定点突变两边一拆,结合和促生长一起垮。但PKIA做不出软琼脂克隆,PKA结合缺陷的BNLF2b突变体还留一部分锚定非依赖生长。RNA-seq给出第二条臂:细胞外基质和上皮间质转化基因(RUNX2、COL1A1、FN1等)上调,失巢凋亡相关基因下调。论文把这叫模仿加码:一边学宿主激酶抑制剂激活MAPK,一边另开转化程序。

为什么重要

这张图把「未注释短ORF大多是噪声」这个默认假设打穿了:二次筛2028个命中里七成没注释,Perturb-seq里强转录表型的75%同样是未注释或几乎没功能注释。对做病毒学和蛋白设计的人,短线性基序加跨膜螺旋这种分子钥匙是可迁移的零件;Rae1和TAP被远缘病毒反复瞄准,像是宿主网上的薄弱点。

BNLF2b把临床观察接上了机制。抗BNLF2b抗体本来就是鼻咽癌筛查标志物,功能一直空着。上皮细胞里它走PKA–MAPK,给MAPK靶向药进EBV相关上皮癌提供了一个实验理由,还没有在肿瘤模型里验证。Perturb-seq规模化之后,整张泛病毒蛋白组可以按功能而不是按序列重排。虚拟细胞建模如果要非CRISPR扰动,病毒ORF是另一类把细胞推到新状态的工具。

局限与存疑

这张图谱是低估。需要别的病毒辅因子才干活的微蛋白会被漏掉,EBV BDLF3.5就是例子:它在病毒前起始复合物里推晚期裂解基因,单独过表达哪张筛都打不中。促癌表型极度依赖细胞类型和培养基,K562几乎看不见促生长,换一套模型可能漏掉同类机制。漏斗入口是生长,MHC-I那40%无生长表型的命中已经说明入口本身在偏样本。

过表达本身也是坑:pTRE可能堆不到生理量,短而不稳定的肽会假阴性;反过来超量表达会造伪表型。他们用长度和物化性质匹配的阴性对照压背景,但不能替代感染情境。AF3对宿主–病毒复合物缺共进化信号,他们只用ipTM>0.75,大量真实界面可能被扔掉,留下来的也还是预测。Rae1和PKA的关键残基靠突变撑住了,其他分子钥匙多数没有同等验证。BNLF2b的肿瘤证据停在RPE-1和口腔角质细胞过表达,没有EBV感染的上皮转化模型,更没有患者组织里的因果数据。

术语

原文与代码

社区讨论

全部论文解读