紧凑CNN加迁移学习,15条合成增强子小鼠胚胎靶组织全激活

2026-08-25

维也纳IMP与欧文UCI用紧凑CNN先学染色质可及性,再在已验证增强子上迁移学习,设计15条心脏、肢体、中枢合成增强子,小鼠胚胎15/15靶组织激活。

这篇在解决什么

增强子是控制基因在哪个组织打开的 DNA 短序列。过去几年,深度学习已经能在果蝇胚胎、斑马鱼和哺乳动物细胞系里预测并设计合成增强子,但活体哺乳动物基因组更长、组织更复杂,同一套方法能不能直接用,一直没被正面验证过。

维也纳 IMP 的 Stark 组和加州大学欧文分校的 Kvon 组把这个问题钉在 E11.5 小鼠胚胎上:心脏、肢体、中枢神经系统三条组织,用序列模型从零设计增强子,再放进活体小鼠里看它到底会不会在该亮的地方亮。

方法

路线分四步,刻意走小模型加少标注,不去碰巨型基因组模型。

迁移学习这一步不是装饰。只训 ATAC-seq,或者不预训练直接训 VISTA,PPV 会掉 20.9% 到 52.1%,掉多少取决于组织。解释性分析也显示,迁移之后组织主调控因子 motif(心脏 MEF2、肢体 TWIST1、中枢 SOX3)的贡献分保持或升高,CTCF 这类广谱绝缘子 motif 被压下去。模型在学「这段开着的染色质是不是真能当增强子」,不是在背染色质状态。

结果

held-out 序列上,三个组织的 sequence-to-activity 模型 PPV 都到了 70.6% 以上。图 1d 给出的峰值是心脏 71.5%、肢体 70.6%、中枢(中脑模型)80.2%,阈值抬到只剩至少 100 条预测阳性时仍能站住。模型还能把 30 万条随机序列和 30 万条不可及基因组片段基本打成零分。

15 条合成增强子在小鼠胚胎里 15 条都在预定靶组织可重复激活。组织专一性并不整齐:

靶组织设计条数靶组织阳性专一性
心脏55/54 条只在心脏;第 5 条心脏较弱,脑有脱靶
肢体55/5肢体强,但在其他表达 TWIST1 的间充质(颅面、躯干)有较弱活性
中枢55/54 条中枢特异;1 条心脏有弱信号

代表性胚胎计数:心脏 7/14、7/7、6/6、3/3、5/8;肢体 4/5、9/9、15/15、15/15、7/10;中枢 5/5、6/7、8/8、6/6、11/11。这 15 条跟小鼠、人基因组以及 VISTA 库都没有显著序列相似(BLAST E-value > 0.05),不是把天然增强子改几个碱基拿回来。

很多组织没有几百条 VISTA 级金标准。他们试了三种从基因组特征推断的标签(远离启动子且不绑 CTCF 的 ATAC 峰、带 H3K27ac 加 H3K4me1 的峰、组织特异 ATAC 峰)来替代 VISTA 做迁移。交叉验证估计,这种推断标签模型设计成功率至少还能到 60%。

中枢亚区更难。两条前脑增强子都在前脑激活(7/8 和 4/4),其中一条肢体有明显脱靶,设计时并没有反向压制肢体。两条中脑增强子一条完全没活性,另一条因为 reporter 里多了一段 419 bp 重复,结果无法解读。亚区特异在原则上能做,现有数据和样本量还撑不起「随便点一个脑区」的说法。

为什么重要

对做基因治疗、合成生物学和功能基因组的人,这篇把「哺乳动物体内组织特异增强子可以按序列设计」从果蝇式的可行性,推到了小鼠胚胎的 15/15。门槛压得很低:紧凑 CNN、公开的 ATAC-seq、每个组织几百条验证过的增强子就够,不需要 Enformer 那种长序列基因组模型,也不需要大规模 MPRA。

模型权重已经放到 Hugging Face(DeepSTARR-Mouse),代码在 Zenodo。想复用的实验室可以直接拿来给新组织微调。没有 VISTA 的组织,用组织特异 ATAC 峰当弱标签,论文自己估成功率大约 60%,这是更接近真实工作流的数字。

15/15 是在高特异、低召回的窄设计空间里挑出来的,不是随机抽 15 条都中。把它读成「模型已经吃透哺乳动物调控语法」会过满。

局限与存疑

论文自己划了边界。测的是标准化 reporter 和启动子背景下的单个增强子元件;天然位点上增强子输出还取决于启动子身份、染色质环境和辅助元件。它也没有处理多基因、多增强子的远程架构,那是长序列基因组模型在攻的方向。组织只覆盖心脏、肢体、中枢,发育阶段只有 E11.5。设计目标没包括指定强度、任意长度、复杂的多组织表达模式。

体内实验通量低,评分由两名实验者非盲完成,阳性标准是「至少三个胚胎可见信号」。肢体那组的脱靶其实是 TWIST1 表达谱的合理外溢,说明模型学到了主调控因子,还没学到把肢体从邻近间充质里切开。中脑亚区的失败样本里还有质粒重复这种实验事故,两条序列的亚区实验撑不起很强的亚区结论。

PPV 70% 以上是在 held-out 的 VISTA 序列上算的,体内 15/15 是从高分候选里人工挑了 5 条/组织。论文没有报告「模型打高分的序列里随机抽 15 条会中多少」。如果后面有人用更高通量的 in vivo MPRA 去扫更大的解空间,这个成功率大概率会下来。

术语

原文与代码

社区讨论

全部论文解读