Xaira 认为药物发现模型要因果数据,不只是堆规模
Latent Space · rss · 2026-07-22
这期 Latent Space 讨论的是 Xaira 的 X-Cell 药物发现模型,以及“因果建模为什么需要因果数据”这个核心问题。
- 团队发现:当模型只在一个相对有限的数据集上训练时,规模继续变大后会很快碰到信息上限——测试损失趋于平坦,但训练损失还在下降。
- 为了突破这一瓶颈,他们构建了更丰富的数据集 X-Atlas,数据来自大规模 CRISPR 实验。
- 这些实验让可用信息量提升了大约 30 倍,模型因此又重新具备了继续靠参数和算力扩展的空间。
- 节目还讨论了团队为什么从自回归转向 diffusion,以及该系统如何泛化到真实的人类细胞实验,并且优于此前的线性基线。
这条内容的核心判断是:生物 AI 的关键可能不是单纯堆参数,而是拿到更“因果”、更富信息量的数据。
「研究」频道最新
- researchers 辩论双向注意力:检索微调放大后因果性或可舍弃 — antoine_chaffin · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11