Xaira 认为药物发现模型要因果数据,不只是堆规模
Latent Space · rss · 2026-07-22
这期 Latent Space 讨论的是 Xaira 的 X-Cell 药物发现模型,以及“因果建模为什么需要因果数据”这个核心问题。
- 团队发现:当模型只在一个相对有限的数据集上训练时,规模继续变大后会很快碰到信息上限——测试损失趋于平坦,但训练损失还在下降。
- 为了突破这一瓶颈,他们构建了更丰富的数据集 X-Atlas,数据来自大规模 CRISPR 实验。
- 这些实验让可用信息量提升了大约 30 倍,模型因此又重新具备了继续靠参数和算力扩展的空间。
- 节目还讨论了团队为什么从自回归转向 diffusion,以及该系统如何泛化到真实的人类细胞实验,并且优于此前的线性基线。
这条内容的核心判断是:生物 AI 的关键可能不是单纯堆参数,而是拿到更“因果”、更富信息量的数据。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27