多组学数据喂 AI 前先过计量门:复旦牵头提参考物质校准,批次间数据才可比

2026-09-03

复旦领衔 18 家机构在 Nature Biotechnology 提议:把标准参考物质与样本同板共测,报告样本/参考信号比(SRR),从测量源头消解批次效应,让多组学数据可复现、可用于 AI 训练。

这篇在解决什么

AI 正在吃掉多组学数据。转录组、蛋白组、代谢组的一次测量产出上万个特征,是模型梦寐以求的高维输入。但这份数据有个计量学死角:同一份生物样本,在两台仪器、两个实验室、两个批次测出来的原始信号(I,intensity)不一样,而且差得没有规律。用这样的数据训练模型,等于让模型把仪器灵敏度差异当成生物差异学进去。

这不是新问题。MAQC(MicroArray Quality Control,美国 FDA 2006 年发起的组学质控联合体)系列研究从 2006 年起反复证实,批次效应是组学不可复现的头号根源,大量再分析发现「同一样本、同一平台,换个批次就变结论」。此前主流的做法是在数据到手后做计算矫正,ComBat、limma、RUV 等方法各自假设「批次结构可从数据内部估计出来」,但 Molania 等人在 Nat. Biotechnol. 41, 82–95(2023)的系统比较里指出,没有外部锚点时这些方法常把真实生物信号一并抹掉。论文标题里的「for artificial intelligence」就是在说:下游模型越强大,上游数据的测量误差越会被放大成系统性偏置。

方法

核心机制一句话:给每个测量批次配一把公共的尺子,让结果以「样本是尺子的几倍」来报告,仪器灵敏度因子在除法里被消掉。

这套逻辑在分析化学里是老规矩——仪器没校准,出的数不算数;在临床检验领域,ICH M10(药物生物分析方法验证的 国际协调指导原则)早已强制要求内标法/比值法报告。这篇评论做的事是把它引入多组学,并论证为什么下游 AI 需要这个计量门。

结果

这是一篇 4 页的评论(Brief Communication),主张 + 图 1 概念图,没有新实验,也没有基线对照表。可以称为「结果」的是它梳理出的论证链:

论证环节依据
批次效应是组学不可复现的根源MAQC 系列研究(Shi et al., BMC Bioinformatics 6:S11, 2005; Nat. Biotechnol. 35:1127, 2017)
纯计算矫正缺外部锚点时失效Molania et al., Nat. Biotechnol. 41:82–95, 2023
计量学方案有成熟先例ICH M10 生物分析指导原则(2023)
慢病精准医学需要可比数据Zheng et al., Nat. Biotechnol. 42:1133–1149, 2024

论文未给出 SRR 与 ComBat 等下游矫正法的直接对照实验,未给出跨实验室 SRR 可比性的量化数字。这些在引文 10(Liu et al., bioRxiv 2026.08.09.740864)里,预印本被 Cloudflare 挣扎着挡住了,本文正文付费墙内,细节无法核实。

为什么重要

对做 AI4Science 的人,这是一篇「数据供给侧」的评论。三点直接相关:

平移成本是每板约 4 个孔位的通量损失,论文未量化,但按 96 孔板计损约 4%。

判断:这是一篇概念提出型评论,不是方法论文。概念本身(测量端校准优于下游计算矫正)站得住,MAQC/Quartet 二十年的数据是硬证据。但对 AI 从业者,它更像一篇「检查你的训练数据有没有校准」的提醒,不是拿来即用的工具。

局限与存疑

4 页短文不可能覆盖全部反例,这不是缺陷,是文体限制。

术语

原文与代码

社区讨论

全部论文解读