JHU 用套娃 SAE 拆开 6 个空间基础模型,只有 Novae 抓住全局梯度

2026-08-22

JHU 用套娃稀疏自编码器 SAFFRON 拆开 6 个空间转录组基础模型。全局 1-D 梯度上 Novae 中位 |ρ|=0.72,其余不到 0.50;阿尔茨海默斑块微环境上没有任何 SFM 赢过 PCA。

这篇在解决什么

空间基因表达叠着两套尺度。一套是全局连续梯度,比如皮层从浅到深、肿瘤从核心到边缘;另一套是局部微环境,比如阿尔茨海默斑块周围几十到一两百微米内的小胶质聚集。空间转录组(ST)能给每个位置一份表达向量,但测序覆盖低、成像面板窄,单张切片很难把这两套变异拆干净。

空间基础模型(SFM)的承诺,是在大批 ST 数据上无监督预训练,给每个细胞或 spot 一个稠密嵌入,指望跨数据集反复出现的空间模式已经写进向量里。现有评测几乎只做嵌入聚类,把组织切成离散空间域。连续梯度抓没抓住、局部微环境有没有,基本没人测。嵌入本身也是黑盒。

方法

JHU 这组人做了 SAFFRON,用稀疏自编码器把 SFM 嵌入拆成可解释特征。具体架构是 Matryoshka SAE,也就是套娃稀疏自编码器:编码器把 D 维嵌入映射成更高维的稀疏向量,解码器必须从特征的多个前缀分别重建原嵌入。前面的维度被迫扛住粗粒度变异,后面的维度才去抠细的。稀疏约束是 BatchTopK。字典大小取嵌入维的 4 倍:Novae 和 SpatialFusion 是 64 维,用 256 个特征、每次激活 16 个;其余 512 或 768 维模型用 1024 个特征、每次激活 64 个,激活比例大约 6%。在 STARmap 脑数据上扫过 Vanilla 与 Matryoshka、TopK、BatchTopK、KL、L1。KL 和 L1 的死特征能到 70%,BatchTopK 套娃方案重建 R²≥0.90,后面实验全用这一套。

评测指标是相关,不是聚类。对每个预先定义的空间标量 τ,取所有 SAE 特征里最大的绝对 Spearman |ρ|。全局 τ 用 GASTON 学出的 1-D 等深轴(isodepth),胃肠道那套用作者给的隐窝-绒毛坐标。局部 τ 三条:26 个 DAM 签名基因的均值、细胞 100 µm 半径内的小胶质数量、到最近 Aβ 斑块的距离。相关只在特征激活大于 0 的位置上算,大致对应一个空间域。相关够高时,再用正交匹配追踪(OMP)找能线性重建 τ 的最小特征子集。

对照包括 4 个 SFM:Transformer 的 Nicheformer 和 scGPT-Spatial,图网络的 Novae,多模态(ST 加 H&E)的 SpatialFusion;2 个非空间单细胞基础模型 Geneformer 和 scGPT;以及 PCA 和直接在基因矩阵上训的 SAE。Novae 跑了从零训、微调、零样本。SpatialFusion 拆了只用 RNA、只用 H&E、两者都用。Nicheformer 和 scGPT-Spatial 没有无监督微调接口,只跑预训练权重。数据 9 套,覆盖 Visium、VisiumHD、MERFISH、Xenium、STARmap,7 套有已知 1-D 梯度,2 套是带斑块的小鼠脑。

结果

全局梯度这一侧,Novae 几乎是唯一明显赢过朴素基线的模型。

方法最大 \ρ\中位数
Novae(预训练或微调)0.72
基因矩阵 SAE0.39
SpatialFusion(加 H&E)0.48,微调后 0.50
其余 SFM / 单细胞 FM<0.50

结直肠肿瘤切片上,Novae 微调最佳特征 |ρ|=0.76,基因 SAE 0.48,scGPT-Spatial 0.26,Nicheformer 和 SpatialFusion-Both 都是 0.42。皮层深度轴上差距更大:Novae 从零训 |ρ|=0.89,基因 SAE 0.29,scGPT-Spatial 0.15,Nicheformer 0.33,SpatialFusion-RNA 0.14。图上看,其他模型的特征空间上散乱,对不上已知轴。

OMP 说明 Novae 把这条轴压进了很少几个特征。从零训的 Novae 用 2 个 SAE 特征就能把肿瘤核心到基质轴重建到交叉验证 R²>0.8,图注写的是 0.81;零样本 Novae 要用满 256 个特征才到 R²=0.89。被挑中的两个特征分管两个域:一个在基质里走基质到肿瘤边缘,一个在肿瘤里走边缘到核心。轴上相关最高的基因 S100A6(ρ=0.59)和 PTPRO(ρ=-0.44),在重建轴上的升降方向与参考轴一致。

局部微环境这一侧,SFM 没有优势。

指标朴素基线基础模型
DAM 分数PCA 中位 \ρ\=0.61,基因 SAE 0.58所有 SFM 更低;非空间的 Geneformer 反而更高
局部小胶质密度中位 \ρ\=0.11–0.21没有基础模型优势
到最近斑块距离PCA 0.23,基因 SAE 0.25Novae 微调 0.33,但空间图对不上斑块距离

DAM 分数本身是 26 个签名基因的均值,基因矩阵基线高相关并不意外。真正该加分的是空间上下文,SFM 没加出来。

为什么重要

这是一篇评测,不是新 SFM。它把「预训练过空间数据」和「嵌入里真有多尺度空间结构」拆开了。想抓连续梯度,目前只有 Novae 的图结构看起来有用:k-NN 邻域加上显式空间域。从零在目标数据上训就已经很强,零样本反而要用更多特征才能拼回同一条轴,功劳更像架构,不像大规模预训练。想抓斑块、微环境这类局部模式,先跑 PCA 或基因矩阵 SAE。

对做模型的人,这是架构信号。现有 Transformer SFM 的空间上下文,无论是 patch sampling 还是邻域转录组 mask,都没有转化成连续空间轴。讨论写得很直:后面该在结构或预训练目标里显式建模局部和全局两套变异。SAFFRON 可以复用,代码开源。

局限与存疑

论文自己的讨论只有一段,承认当前 SFM 没有系统学到多尺度空间变异。几个没写透的点更关键。

评测全是跟预先定义好的 τ 做相关,不是从嵌入里发现未知空间模式。OMP 选特征时也看见了参考轴,不需要先验就能重建这件事,还没有单独验证。相关只在特征非零的位置上算,等于先圈一个空间域再比,分数可能被抬高。

局部实验只覆盖阿尔茨海默斑块一种微环境。DAM 分数又跟基因表达直接绑定,基因基线占优有循环成分。Transformer 系 SFM 没做微调,和 Novae 的三档设置不完全对称。Novae 从零训已经很强,这篇没有把「图架构」和「大规模预训练」拆开定量。bioRxiv 预印本,尚未同行评审。

术语

原文与代码

社区讨论

全部论文解读