专题 · FULL STORY

AlphaGenome争议:性能神话还是刷分注水

DeepMind AlphaGenome 发布后,Salzberg 质疑其性能夸大,斯坦福教授 Kundaje 发长文辩护;随后 Vierstra 等研究者实测蒸馏版仅居中游,Kundaje 再回应称预蒸馏基座模型潜力仍大。争论从口水战走向实测检验。

2026-09-18 ~ 2026-09-19 · 3 集 · 40 条

第 1 集 · Kundaje 评 DeepMind AVI:前沿水准但非颠覆,非 AI slop(2026-09-18,35 条)

斯坦福计算基因组学教授 Anshul Kundaje 于 9 月 18 日发布长线程,回应 Steven Salzberg 称 DeepMind AlphaGenome Atlas 是「AI slop 席卷基因组学」的批评,并对 DeepMind 推出的 AVI(AlphaGenome Variant Impact)分数做了系统性技术评测。他的结论是:该工作扎实、有竞争力,但并非颠覆性突破,使用时需理解其定位与局限。次日他还回应了 jeffvierstra 对 AlphaGenome 蒸馏价值的质疑,重申「不该叫 AI slop,它离垃圾差得远,基本处于前沿水准」,其实际价值有待社区在变异优先级排序中的使用检验。

已确认

  • AVI 是全基因组范围的变异影响优先级排序分数,对全部 90 亿个可能变异统一排序并做 PHRED 缩放:AVI 10 对应前 10%、20 对应前 1%、30 对应前 0.1%、40 对应前 0.01%。Kundaje 特别澄清它不是「变异是否致病」的校准概率,不应按概率解读。
  • 技术路线上,AVI 用常见/稀有变异频率做代理训练分类器:频率 ≥0.1% 的常见变异被当作(有噪声的)中性/良性代理,更稀有变异则富集潜在有害影响。这种以负选择信号为代理的范式并非首创,最直接的对标对象是广泛使用的经典评分 CADD。
  • 特征构成:AlphaGenome 在数千条 track 上预测的参考 vs 替代变异效应被压缩为 10 个跨细胞类型特征(覆盖染色质可及性、转录因子、转录、剪接、多聚腺苷酸化、3D 接触等类型),再与 AlphaMissense 蛋白编码变异分数、2 个保守性分数、3 个蛋白功能缺失(LoF)注释和 indel 指示符合并,共 18 个特征/变异,喂入线性超网络集成得到单一影响分。
  • 评测结论:AVI 论文作者在针对罕见与常见变异的多个公认基准上与其他 SOTA 变异优先级分数做了正式对比,结果互有胜负——部分指标略微领先、部分明显更好。原版 AlphaGenome 论文的基准全景也显示其普遍优于既有 SOTA,但多数具体任务上并非巨大飞跃;评测通常针对扰动实验、合成文库、银标准因果变异集等实验数据类型。
  • 可解释性是亮点:AVI 能给出某变异被优先排序的功能性假设(如结合、可及性变化),生物学家或 AI 模型可据此推理该解释是否合理;研究者还可直接在 AlphaGenome 模型上使用解释方法,下钻定位变异破坏了哪些序列特征(如 motif)、影响哪些细胞类型中的哪些读出。

尚未确认

  • ctokheim 在转发讨论中质疑:AlphaGenome 虽以非编码变异解读为主打卖点,但其蛋白编码变异解读的多处结果让人怀疑存在为炒作而「优化基准」的成分。这属于个别研究者的质疑,尚无系统评测佐证。

Kundaje 的批评与保留意见

  • 把上下文特异的变异效应压缩成与疾病无关的通用评分是常见的有损做法:不同疾病和性状关联不同细胞上下文,会丢失大量信息。他提出可学习表型评分,把分子效应映射为疾病特异性优先级,并认为 AI 智能体与模型解释技术为在多维评分上直接推理创造了机会。
  • 关于宣传尺度:论文作者与整个领域共识是 AlphaGenome 及类似模型距「解决」基因调控序列密码仍非常遥远,论文对改进与局限的表述是坦诚的;DeepMind 的营销话术虽欠细致,但相比业内常见宣传尺度仍在合理范围。
  • 他认为监督式序列到组学模型的核心优势在于学到上下文特异调控逻辑,而未以细胞上下文为条件的 DNA 语言模型在非编码变异预测上表现吃力。

为什么重要

AVI 是 DeepMind 将 AlphaGenome 系列推向临床级变异解读的尝试,其评测结果与可解释性直接关系罕见病遗传诊断中变异优先级工具的选型;Kundaje 的长文为社区提供了一份来自顶级第三方专家的平衡评估,既反驳了「AI slop」的过度贬低,也提醒不要被营销带偏,同时留下了 ctokheim 关于蛋白编码变异解读是否「刷分」的争议待社区检验。

还有 15 条相关讨论 →

第 2 集 · 实测质疑 AlphaGenome 蒸馏版:仅居中游(2026-09-19,3 条)

研究者 Jeff Vierstra 在与 Anshul Kundaje、Steven Salzberg 等人的讨论中分享了对 AlphaGenome 等基因组模型的横向实测结果:去除蒸馏因素后,AlphaGenome 在跨多种细胞类型的评测中仅处中游,各模型间预测相关性几乎相同。在衡量细胞选择性的细分评测中,chromBPNet 表现最佳。Vierstra 还质疑 Google 的蒸馏发布方式,认为单纯报告 90 亿个预测并非目标所在。

第 3 集 · 基因组模型之争:学者回应蒸馏质疑,称微调空间仍大(2026-09-19,2 条)

围绕 AlphaGenome 等基因组基础模型的蒸馏(distilled)版本引发的质疑,斯坦福学者 Anshul Kundaje 回应称,预蒸馏版本的基座模型是公开的,团队已做过大量蒸馏与非蒸馏模型的对比分析。初步观察显示预蒸馏基座质量依然很高,可支持针对特定目标的快速微调,但他也承认细胞类型特异性仍是待解决的问题,损失函数与数据采样策略仍有挖掘空间。