2026-07-28
ArchVelo 用原型分析(一种经典可解释的凸矩阵分解)把单细胞 ATAC 染色质分解成少数原型调控程序,耦合进 RNA velocity 动力学模型做轨迹推断;在小鼠脑、人造血基准上准确率和基因级潜时间对齐都优于 scVelo、DeepVelo、MultiVelo 等六个方法,还能把速度场拆成原型成分并提名驱动转录因子。
单细胞测序能给每个细胞拍一张「基因表达快照」,但细胞是动态的:分化、激活、增殖都在变。怎么从一堆静态快照里推断出「谁在往哪走」的轨迹,是单细胞基因组学的老难题。RNA velocity 这类方法利用未剪接/已剪接 RNA 的比值,用微分方程建模每个基因的转录动力学,再拼出每个细胞的速度向量。问题是单细胞数据噪声大、稀疏,模型既不稳健也不好解释。
多组学(scATAC+RNA-seq)同时测同一个细胞的基因表达和染色质开放性,本该给更直接的调控信息,但现有方法(如 MultiVelo)把一个基因的所有染色质峰求和成一个值,丢掉了「多个调控元件各自响应不同上游信号」的复杂性。ArchVelo 来自 Flatiron 研究所和普林斯顿,要解决这个问题。
核心是把染色质开放性数据交给原型分析(archetypal analysis)。这是一种经典的无监督学习方法,属于凸矩阵分解家族(和 NMF、PCA 是亲戚):它假设每个细胞的数据可以表示成少数几个「极端」原型(profile)的凸组合,每个原型代表一种特征性的调控程序。这样既降维,又给出可解释的、生物上有意义的基。
在这个低维表示上,ArchVelo 把每个基因的转录速率建模成若干原型的线性组合(而不是 MultiVelo 那样求和成单值),再耦合进扩展的 RNA velocity 微分方程,联合描述染色质开放性和转录的动力学。原型是跨基因共享的,这给潜时间估计一个共同约束,提升了一致性。
论文在小鼠胚胎脑和人造血干细胞分化两个公开多组学数据集上,把 ArchVelo 和 scVelo、MultiVelo、DeepVelo、VeloVI、TFVelo、Cell2Fate 六个方法对比(覆盖了经典、深度网络、深度生成式、贝叶斯几条技术路线):
它还多一个能力:把 RNA 速度场分解成原型特异的成分,结合转录因子 motif 分析,能提名驱动某条调控成分的候选转录因子。作者把它用到病毒感染中的 CD8 T 细胞,分出功能分化与增殖两条轨迹,并在耗竭前体细胞里找到一条此前的 Ccr6 阴性到 Ccr6 阳性的分化路径。
对单细胞和计算生物学从业者,ArchVelo 给了一个更准也更可解释的多组学轨迹推断工具(已开源,github.com/pritykinlab/ArchVelo)。对更广的 AI 读者,它是一个反例:在一个结构足够清晰的任务上,一个经典、可解释、线性的方法(原型分析加凸组合加 ridge 回归)能稳定打败专门设计的深度模型(DeepVelo 的图卷积、VeloVI 的 VAE)。先验结构和可解释基,有时比堆网络更值钱。
论文的基准指标多是分布层面的(scatterplot、log-likelihood、silhouette、CBDir),没有给出一个简洁的「绝对准确率」式单一数字,跨方法的优势幅度需要读者自己从图里读。「比深度学习准」主要是在这两个数据集和这套评价指标下成立,换数据集、换 ground truth 图结论是否还稳,论文没有系统扫。原型个数 K 是预设的(K=8 是示例),敏感性分析只在补充材料里。生物学发现还需要实验验证,计算轨迹本身不等同于机制证明。