单细胞模型赢不了线性基线,Cell 列 15 道生成式 AI 难题

2026-08-18

Cell 视角论文提出 15 道生成式 AI 生物挑战:生物数据比语言模型少千倍、线性基线难超越,出路是把先验写进架构加前瞻盲测。

这篇在解决什么

AlphaFold 拿了诺贝尔奖,蛋白设计、突变致病性预测接连告捷,一个自然的问题是把同一套生成式 AI 搬到细胞层面,能不能预测免疫反应、肿瘤微环境、神经退行。这篇 Cell 视角文章(通讯作者 Andrea Califano,哥伦比亚大学,15 位作者横跨 Columbia、Stanford、Northwestern、CMU、Rockefeller、Yale)的回答是:现在还不能,而且差距是结构性的。

三个数字撑起这个判断。临床转化上,2006-2022 年只有 14.6% 的临床试验最终获批上市,2014-2023 年进一步掉到 6.7%。数据上,语言模型训练用上万亿 token,生物学最大的数据集只有 10^1010^11 量级测量值,差约一千倍,把 CellxGene 的十亿级单细胞数据全算上也补不回缺口。组合复杂度上,组装一个 60S 核糖体亚基需要最多 47 个蛋白协同,这个量级的组合空间约 3.48×10^150,比宇宙原子数(约 10^80)还大。靠堆数据硬学,学不动。

方法

文章仿照希尔伯特 1900 年的 23 个数学问题,列出 15 道大挑战,分四层:

每道挑战都配了验收标准。挑战 3(细胞间通讯)要求 AUROC ≥0.85 且在至少 3 种组织场景验证;挑战 7(最小基因组)要求预测的必需基因集与 JCVI-syn3A 重叠 ≥90%;挑战 11(生物标志物)要求前瞻队列 AUC ≥0.90、标志物面板不超过 20 个特征、至少 2 个独立队列复现;挑战 15(临床试验)要求前瞻 II/III 期试验中应答者判别 AUC ≥0.80。

基准分两档:tier 1 做回顾性相对排名,tier 2 做前瞻盲测,预测先封存、实验后揭晓,仿照蛋白质结构预测社区赛 CASP。

架构上主张把生物先验(分子互作网络、物理约束)用图注意力预先接进模型,让注意力只在已知机制上流动。作者自己的 GREmLN(把分子互作网络做进注意力的转录组基础模型)称这样能以更少数据和参数换更高性能,尤其在被认为更难的基因扰动预测上;该模型已申请专利,性能表述属作者自证。

文章还正面回应 Sutton 的「苦涩教训」(算力与通用方法终将碾压人类知识)。三条反驳:生物数据天然稀缺;蛋白互作受热力学与静电学支配,编码物理定律不是塞人类直觉;医学等不起,语言建模可以等算力,临床试验每年都在产生失败。

结果

视角文章没有新实验,全部论据来自既有文献,关键证据如下:

证据数字对照
临床试验获批率14.6%(2006-2022)降至 6.7%(2014-2023)
生物数据规模10^1010^11 token语言模型万亿级,差约千倍
单细胞基础模型分布外表现与线性基线打平scGPT、Geneformer 被测,Nature Methods 2025
免疫疾病预测样本门槛非线性优势需 >100 万人PRSformer
47 蛋白组合空间3.48×10^150宇宙原子 10^80

基准批判值得单独说。「按基因表达分类细胞类型」这类标配基准(区分 CD8+ 与 CD4+ T 细胞)在生物学上无意义,线性回归能做得跟最好的生成模型差不多,拉开差距的显著性是上万细胞量级堆出来的。AUC 指标也有问题:精确率/召回率曲线上只有 FDR ≤5% 的区段对实验设计有用,其余约 95% 的曲线面积与生物学无关。1995 年华盛顿邮报曾宣告蛋白质折叠已解(7 个蛋白猜对 6 个),真正的解法等了 40 年才通过前瞻验证落地,这是回顾性指标骗人的历史注脚。

为什么重要

对做 AI4Science 的人,这是一份可直接引用的选题地图:15 道挑战每道都给了数据可得性评估与必须对比的非 AI 基线(计算方法加实验方法),方向、对手、及格线在表 2 里全有。

对 benchmark 作者,两档框架加上「AUC 大部分区段与实验设计无关」的论证,是对单细胞基础模型现行评测的具体否定;2025 年已有 Nature Methods 论文证明线性基线分布外不输深度模型,这篇把那件事上升为结构性问题。

对资助机构与数据平台,文章主张建公私联盟,5 年内攒 500 个带分子层面数据的临床试验(优先从已失败试验起步),配套 AI-DREAM 式盲测。Human Immunome Project、DepMap、Tahoe-100M 这类计划由此拿到了明确用途。

局限与存疑

视角文章无实证评估,15 道挑战是议程设置不是被验证的结论;作者也承认生物学问题无法像希尔伯特问题那样公理化,只能算开放式纲领。

利益相关要打折:GREmLN 是作者团队模型且已申请专利,「图先验有效」的核心论据部分来自自证;多位作者挂职 Biohub、CZI、GenBio.AI,议程与这些机构的数据生产计划同向。

验收线(AUC ≥0.90 之类)是直接给定的,没有推导;「临床医生需要可解释模型所以先验重要」只有断言没有证据。15 道挑战难度极不均衡,从突变功能预测(AlphaMissense 已在做)到临床试验结局预测(可能几十年内无解)跨度太大,并列呈现容易误读优先级。

论文披露写作过程用了 Claude Sonnet 4.6 核对参考文献与语法,概念出自作者。

术语

原文与代码

社区讨论

全部论文解读