多组学数据喂 AI 前先过计量门:复旦牵头提参考物质校准,批次间数据才可比
2026-09-03
复旦领衔 18 家机构在 Nature Biotechnology 提议:把标准参考物质与样本同板共测,报告样本/参考信号比(SRR),从测量源头消解批次效应,让多组学数据可复现、可用于 AI 训练。
这篇在解决什么
AI 正在吃掉多组学数据。转录组、蛋白组、代谢组的一次测量产出上万个特征,是模型梦寐以求的高维输入。但这份数据有个计量学死角:同一份生物样本,在两台仪器、两个实验室、两个批次测出来的原始信号(I,intensity)不一样,而且差得没有规律。用这样的数据训练模型,等于让模型把仪器灵敏度差异当成生物差异学进去。
这不是新问题。MAQC(MicroArray Quality Control,美国 FDA 2006 年发起的组学质控联合体)系列研究从 2006 年起反复证实,批次效应是组学不可复现的头号根源,大量再分析发现「同一样本、同一平台,换个批次就变结论」。此前主流的做法是在数据到手后做计算矫正,ComBat、limma、RUV 等方法各自假设「批次结构可从数据内部估计出来」,但 Molania 等人在 Nat. Biotechnol. 41, 82–95(2023)的系统比较里指出,没有外部锚点时这些方法常把真实生物信号一并抹掉。论文标题里的「for artificial intelligence」就是在说:下游模型越强大,上游数据的测量误差越会被放大成系统性偏置。
方法
核心机制一句话:给每个测量批次配一把公共的尺子,让结果以「样本是尺子的几倍」来报告,仪器灵敏度因子在除法里被消掉。
- 参考物质(Reference Material, RM):组分确定、性状稳定的生物标准品(比如一套混匀的血浆/细胞系标准品),所有实验室都用同一批。
- 共测(co-profiling):每块 96 孔板除了待测样本,固定留约 4 个孔位给 RM,和样本走完全相同的提取、上机、检测流程。
- SRR(Sample-to-Reference Ratio):样本信号除以同板 RM 信号。图 1 的推导很直白:仪器响应 I = f × C(f 是该仪器的灵敏度,C 是真实浓度),于是 Isample/IRM = (f×Csample)/(f×CRM) = Csample/CRM。两台灵敏度不同的仪器,只要各自带上同一款 RM,比值就收敛到同一浓度比,f 被约掉。
- 报告方式改变:数据库里存的不再是原始 intensity,而是 SRR。
这套逻辑在分析化学里是老规矩——仪器没校准,出的数不算数;在临床检验领域,ICH M10(药物生物分析方法验证的 国际协调指导原则)早已强制要求内标法/比值法报告。这篇评论做的事是把它引入多组学,并论证为什么下游 AI 需要这个计量门。
结果
这是一篇 4 页的评论(Brief Communication),主张 + 图 1 概念图,没有新实验,也没有基线对照表。可以称为「结果」的是它梳理出的论证链:
| 论证环节 | 依据 |
| 批次效应是组学不可复现的根源 | MAQC 系列研究(Shi et al., BMC Bioinformatics 6:S11, 2005; Nat. Biotechnol. 35:1127, 2017) |
| 纯计算矫正缺外部锚点时失效 | Molania et al., Nat. Biotechnol. 41:82–95, 2023 |
| 计量学方案有成熟先例 | ICH M10 生物分析指导原则(2023) |
| 慢病精准医学需要可比数据 | Zheng et al., Nat. Biotechnol. 42:1133–1149, 2024 |
论文未给出 SRR 与 ComBat 等下游矫正法的直接对照实验,未给出跨实验室 SRR 可比性的量化数字。这些在引文 10(Liu et al., bioRxiv 2026.08.09.740864)里,预印本被 Cloudflare 挣扎着挡住了,本文正文付费墙内,细节无法核实。
为什么重要
对做 AI4Science 的人,这是一篇「数据供给侧」的评论。三点直接相关:
- 它把组学 AI 的可复现性问题上移到了测量环节。此前讨论集中在模型侧或矫正算法侧,这篇明确说:毛病在数据出厂时就没校准,下游救不回来。训练数据跨批次不可比,模型学到的「特征」里掺着仪器指纹,外部验证时一换平台就崩。
- 方案是工业界已有纪律的平移,不是新发明。内标法/比值法报告是分析化学和临床检验的常识,ICH M10 是法定框架。组学数据进 AI 管线前也过同一道门,执行成本低、心智负担小,比每次训练前重跑一套矫正 pipeline 更接近「制度化可复现」。
平移成本是每板约 4 个孔位的通量损失,论文未量化,但按 96 孔板计损约 4%。
- 多模态融合的前提是各模态可比。蛋白组和代谢组各测各的、原始信号量纲不同,直接拼进一个模型等于拼两把不同的尺子量出的数。SRR 让每个模态都锚定同一物理基准,多模态融合才有一个统一的计量基础。
判断:这是一篇概念提出型评论,不是方法论文。概念本身(测量端校准优于下游计算矫正)站得住,MAQC/Quartet 二十年的数据是硬证据。但对 AI 从业者,它更像一篇「检查你的训练数据有没有校准」的提醒,不是拿来即用的工具。
局限与存疑
- 正文付费墙内,主张多于细节。4 页评论,方法细节、SRR 的具体计算流程、跨实验室验证数字都散在引文里,无法从本文独立核实。引文 10(配文预印本)也被 Cloudflare 挡住,未能读到。评估实际效果要等引文 10 的实证部分。
- SRR 是线性近似的产物。I = f×C 假设仪器响应线性、f 在动态范围内恒定。真实质谱/测序仪响应在高低浓度端都有非线性,比值法在高动态范围场景(代谢组常见)是否仍无偏,本文未讨论。
- 成本与通量。每板约 4 个孔位给 RM 是通量损失,论文没给成本估算。对大规模样本集(如 UK Biobank 级别的项目)是否可行,没算账。
- 评论观点不代表监管落地。多位作者是 FDA 官员,但这是个人学术观点,不是 FDA 立场,更不是合规要求;论文自己也在致谢外声明「观点属于作者」。
4 页短文不可能覆盖全部反例,这不是缺陷,是文体限制。
- AI 相关性是论证性的。文中并未拿真实 AI 模型在 SRR 数据 vs raw 数据上做对照实验。「适合 AI」是推论,不是实测。评论结尾的「Robust AI/ML model」停留在图 1 的示意层面。
术语
- 多组学(multiomics):同一样本上同时测转录组、蛋白组、代谢组等多个分子层,拼出更完整的生物状态画像。
- 参考物质(Reference Material, RM):组分确定、量值稳定的标准样品,计量学里当「公共尺子」用。
- SRR(sample-to-reference ratio):样本信号除以同板参考物质信号所得的比值,用公共尺子约掉仪器灵敏度。
- 批次效应(batch effect):与生物学无关、由实验操作/仪器/时间引入的系统性测量差异。
- MAQC/Quartet:FDA 2006 年发起的组学质控联合体及其后续项目,二十年批次效应与可复现性数据的来源。
- ICH M10:药物生物分析方法验证的国际协调指导原则,内标/比值报告的现行法规框架。
原文与代码
社区讨论
全部论文解读