10kb外AlphaGenome与删除实测相关掉到−0.12

2026-10-10

斯坦福的 Swap-seq 在单核细胞 PPIF 位点定量了 117 个内源删除。距转录起始位点 10 kb 以内,AlphaGenome 与实验的相关是 0.76,再远则掉到 −0.12。

这篇在解决什么

从 DNA 序列预测表达的模型,窗口已经到 100 kb 甚至 1 Mb。缺的是内源位点上的干净删除,以及删除后邻近基因表达变了多少。报告基因实验能提名增强子,但说不清靶基因,也不测内源效应。CRISPRi 靠 KRAB 沉默,基因内部的增强子、CTCF 位点和沉默子容易漏。双引导 Cas9 删除会留下 indel 和倒位,混合池里也核对不了编辑结果。PPIF 在 THP-1 单核细胞里调节线粒体通透性,被估计处在增强子景观最复杂的前 10%。同一位点以前的 CRISPRi-FlowFISH 只找到 5 个元件。

方法

Swap-seq 用 twin prime editing。成对 pegRNA 删掉 50 到 250 bp,写入 71 bp 条形码盒,其中 8 bp 专属于这一次编辑。不切断双链,非预期 indel 更少。效应直接数留在编辑位点上的条形码,不靠引导 RNA 的丰度去猜。

文库打在 PPIF 启动子、第一剪接接头和 24 个候选元件上:CRISPRi 已经命中的远端增强子、强 H3K27ac 的可及峰(三个在基因内部)、五个 CTCF 位点,以及其他可及区。邻近基因 ZMIZ1、ZCCHC24 的启动子用来排除反式效应。对照是其他染色体上的可及区,以及只带条形码、没有 pegRNA 的构建。一共 208 个删除,每个至少 4 条条形码,共 860 对 pegRNA。条形码先用 ChromBPNet 筛过。这个模型按序列预测 THP-1 的染色质可及性,用来丢掉会偶然造出转录因子位点的序列。

细胞是可诱导表达 PE2 的 THP-1。低感染复数导入后,强力霉素诱导编辑 14 天,再撤药 7 天等 PE2 降解。RNA FlowFISH 染出 PPIF 的 mRNA,按表达分成 4 箱,用最大似然估计效应,并把编辑效率算进去。三个试点位点上,71 到 215 bp 的预期删除效率是 3.6% 到 71.5%。

结果

过了频率门槛的是 117/208 个编辑。生物学重复 Pearson r = 0.97,技术重复 0.90 到 0.97,同一编辑的四条条形码之间 r = 0.95。860 条条形码里,505 条等位基因频率超过 0.001%,大约每条 1000 个细胞。启动子删除使 PPIF 下降 69% 到 90%。BH 校正 p < 0.001 的显著编辑有 48 个,落在启动子、剪接接头和另外 16 个元件上。只含条形码的对照不影响表达。纯合克隆的 qPCR 与混合池一致。

和 CRISPRi 的效应相关是 r = 0.75(18 个元件)。Swap-seq 找回四个已知远端增强子,并叫出 CRISPRi 漏掉的元件,包括基因内部增强子 g1、g2。CRISPRi 打在基因体上通常会直接压低转录,所以测不到它们。CTCF 位点 c2 的纯合删除使 PPIF 下降 14.4%,绝缘变弱,启动子与远端增强子 e1、e2 的接触下降。

沉默子 s1 位于 ZCCHC24 的内含子,距 PPIF 启动子 57 kb。五条覆盖删除都把 PPIF 抬高 25% 到 29%,CRISPRi 打同一元件只抬高约 8%。纯合克隆里 ZCCHC24 上升 360%。这很难解释成 s1 只通过改变 ZCCHC24 再去影响 PPIF:直接扰动 ZCCHC24 启动子,PPIF 也会上升。s1 没有强的启动子接触,也没有明显的 H3K27me3 或 H3K9me3。报告基因实验里,正反两个方向都能压低 PPIF、EF1A 和 FTH1,最多约 25%。IIa 类 HDAC 抑制剂 TMP269 使带沉默子的报告基因相对溶剂去抑制 1.8 倍,EZH2 抑制剂没有显著变化。内源删除之后,两侧各 30 kb 内多个可及峰的 H3K27ac 上升,可及性和 H3K27me3 在切点以外没有显著变化。s1 靠 HDAC 压低旁边的增强子,再间接调节远端基因。

5 bp 编辑破坏 RUNX 和 CEBPA 位点后,PPIF 上升 3.7% 到 10.5%。吻合 ZNF324 的相邻两个 5 bp 删除,最多抬高 17.4%,ChromBPNet 没有把这段排进来。全基因组高可及、H3K27ac 相对低的峰里,160 个带有 RUNX、GABPA、CEBPA、ZNF324 中至少三个 motif。旁边基因的表达低于增强子样峰(Mann-Whitney p = 2.2×10^-214)。这 160 个峰没有再用删除逐个验证。

18 个元件上的 48 个显著编辑,拿去对 AlphaGenome、Enformer 和 Borzoi。总体 Pearson r 为 0.64 到 0.78,主要来自距转录起始位点 10 kb 以内的编辑。

设置对照Pearson r
距 TSS <10 kb,n=20AlphaGenome,THP-1 CAGE0.76
距 TSS >10 kb,n=28AlphaGenome,THP-1 CAGE−0.12
远端相关的高值Enformer,CD14+ 单核细胞 CAGE0.27

AlphaGenome 的 CD14+ RNA-seq 和 Borzoi 的 CD14+ CAGE 也落在 −0.12 到 0.27 这一档。把增强子 e2 和沉默子 s1 放到离启动子很近的报告基因上,AlphaGenome 能抓住 e2 的激活。它对 s1 的预测随启动子和序列背景在抑制与激活之间切换,也没有把效应传到内源的远端靶基因。

为什么重要

1 Mb 的输入窗口,没有换成 10 kb 以外的预测能力。近端编辑混进一个总相关,这个失败就被藏住。评测基因组序列模型时,远端元件、沉默子和 CTCF 位点要分开报。

CRISPRi 仍然更适合大规模扫增强子和启动子。删除实验补上的是它的机制看不到的类。s1 没有 H3K27me3 或 H3K9me3,按这两种标记去找沉默子会漏掉。FlowFISH 一次只读一个基因,编辑效率可以差一百倍以上。它适合生产金标准数据。

局限与存疑

论文自己写了三条。FlowFISH 每次只量一个靶基因,要铺到全基因组,得改成生长或分化这类可分选表型。编辑效率随可及性和组蛋白修饰变化,异染色质里的元件还没证明打得动。这篇用的是可诱导 PE2,效率波动大。按平均 5% 编辑率、感染复数 0.3 下约 20% 细胞过筛选估算,200 个编辑的文库,每个生物学重复至少要感染 2 亿个细胞。

−0.12 只来自 PPIF 一个基因座上的 28 个远端编辑。AlphaGenome 对的是 THP-1 CAGE,Enformer 和 Borzoi 对的是 CD14+ 单核细胞轨迹,跨模型并不是同一条输出。预印本于 2026 年 10 月 9 日贴出,未经同行评审。

术语

原文与代码

社区讨论

全部论文解读