2026-08-10
用 1.12 亿人类细胞空间转录组自监督预训练,TERRA 单模型同时输出基因、细胞、邻域三层嵌入,零样本跨组织识别 niche 并支持虚拟基因敲除。
空间转录组(spatial transcriptomics)能把基因表达定位到细胞甚至亚细胞分辨率,看清细胞怎么组成多细胞微环境(niche)。但拿到数据之后的分析一直是「一个数据集一套流程」:换一批样本、换一种测序平台,就得重新调参、重新标注,出来的结论也很难跨研究复用。更麻烦的是,现有工具大多只描述现象,没法预测「敲掉某个基因,这块组织会怎么变」。
单细胞测序那边已经有 Geneformer、scGPT 这类基础模型,在解离下来的细胞上学到可迁移的表示。可它们看不到细胞原本在组织里的位置和邻居关系。已有的空间基础模型又多只在单一尺度上工作、依赖针对数据集的训练,或者丢掉了基因级别的分辨率。独立基准还显示,这些模型的零样本嵌入有时被简单基线追平,扰动预测也没赢过线性模型。TERRA 要填的就是这个空:一个在亿级真实空间数据上预训练、能零样本跨组织用、同时保留基因/细胞/邻域三个尺度、还能做原位扰动预测的模型。
TERRA 的预训练语料叫 HST-Corpus-112M,是 1.12 亿个单细胞分辨率的人体空间转录组剖面,来自 636 个组织切片、5 种成像式测序平台(Xenium、MERFISH、CosMx、STARmap、ISS CARTANA),覆盖 20 种人体组织和 26 种疾病。为了把训练和评测分开,作者训了两个版本:TERRA-112M 用全量做全库分析,TERRA-96M 留出 215 个切片不参与训练,专门做零样本评测。
架构上有两个关键选择。第一是「空间感知分词」:每个基因被表示成四元组,包含基因符号、表达量、细胞内表达排名,以及这个细胞在邻域里相对中心细胞的距离排名。把表达排名和绝对表达量一起编码,既给了一个对文库大小和检测灵敏度不敏感的尺度无关归一化,又保留了排名丢掉的定量信息。第二是用 JEPA(联合嵌入预测架构)预训练:保留一部分基因 token 当上下文,遮住其余当目标,在隐空间里预测被遮部分,而不是重建原始计数。这个选择是冲着空间转录组数据稀疏、噪声大、各平台基因 panel 不一的特性去的:重建噪声没意义,学到稳定的微环境结构才有。
还有一个轻量的 batch metatoken,训练时同时喂给上下文和目标流,推理时填默认值,让模型在没有显式批次校正的情况下跨平台整合。消融显示去掉它,跨平台混合就垮掉。
评测覆盖从「没见过的样本」到「没见过的供体、数据集、平台」四个泛化难度递增的等级。在零样本 niche 识别上,TERRA 在每个留出数据集上的 NMI 都高于四个对比的空间基础模型(CellPLM、Nicheformer、scGPT-spatial、Novae)。
| 任务 | 设置 | 结果 |
| niche 识别 | 留出数据集零样本 | 每个数据集 NMI 最高 |
| niche 标签迁移 | 多患者皮肤数据,留出患者 | 比 spatial FM 更准,微调比线性探针增益很小 |
| 跨平台适配 | 10x Visium 胚胎 52 切片,LoRA 训 42 评 10 | 零样本与 LoRA 都优于 scGPT-spatial |
| 细胞类型识别 | 留出数据集 | 与最强 spatial FM 持平 |
| 疾病分类 | 湿疹 vs 银屑病,患者/样本级 | 与最佳模型相当 |
结果里最实在的一段是扰动预测。在没接受过治疗的肾切片上,对免疫检查点阻断(ICB)靶基因做虚拟敲除,TERRA 预测出一个 23 基因的肾毒性特征。这个特征在长期接受 ICB 治疗的肾皮质里被验证,定位到淋巴细胞浸润区,还能在患者外周血单核细胞的 scRNA-seq 里被检出,并且在临床上确诊 ICB 相关肾损伤的患者里上调。这套「在未治组织上预测、在治疗组织上验证、在外周血里回捞」的闭环,是这篇最硬的结果之一。
另外,在一个 9 器官、2800 万细胞的子集上,TERRA 把巨噬细胞所在的微环境归纳成六类跨器官复现的原型(archetype)。其中一类富含巨噬细胞和成纤维细胞、做细胞外基质重塑,在独立的肾癌队列里与预后不良相关,位置对应肾癌的假包膜结构。
对做计算生物学和 AI4Science 的人,TERRA 想做的是把空间转录组分析从「每篇论文一套 pipeline」拉到「一个可复用的预训练底座」上,类似 ESM 之于蛋白质、AlphaGenome 之于基因组。一个模型同时产出基因、细胞、邻域三层嵌入,意味着同一次推理就能兼顾细胞身份、基因程序和组织微环境,不必为每个任务单独训模型。
对药物研发,虚拟基因敲除的能力有实际价值:在真实实验之前,先在原位组织上预筛靶点扰动会引发什么细胞和微环境响应。ICB 肾毒性这个例子就是从预测一路验到临床样本。它是一个能省实验的早期信号工具,不是替代实验。
论文自己列得很清楚:预训练只用成像式平台和靶向基因 panel,基因覆盖受限(虽然能用 LoRA 适配 10x Visium 这类测序式平台);邻域用固定的 k 近邻图定义;niche 和基因程序的命名仍依赖专家解读;评测依赖并不完美的参考标注,可能低估了表示的真实质量;胰腺和肾的零样本分析样本量小,没法充分顾及性别、个体差异等变量。
读下来还有两点存疑。第一是评测的天花板:NMI 这类指标依赖参考标注,而参考标注本身就不全准,「最高 NMI」在高分区段未必意味着有意义的领先,论文也承认这点。第二是扰动预测的有效性边界:作者把它定位成「complementary first step」,坦白空间扰动的观测数据还很少,这套虚拟敲除更多是用大观察语料做外推,和真正在解离细胞大规模筛选上学扰动响应的模型不是一回事。在 23 基因肾毒性这个例子里它确实闭环了,但能否推广到更多基因和场景,还没被验证。