新论文质问:基因表达基础模型的基准评测真的有信息量吗
simocristea · x · 2026-10-02
作者高兴地宣布其论文通过同行评审正式发表。论文提出并形式化了一个尖锐问题:我们用于评估基因表达数据基础模型(bio FM)的 benchmark,真的有信息量吗?
关键论点:
- 预训练或评测过生物基础模型的人都清楚这件事很难,常用做法之一是看算术平均误差——把训练细胞中的基因表达信号取平均,与模型在测试细胞上的预测误差对比。
- 但这个平均往往覆盖大量基因,其中多数与想测量的表型毫无关系,却仍被纳入评测。
- 原因在于:很多时候我们并没有对真正关心的表型的实测手段。
论文对生物基础模型评测方法的有效性提出了系统性质疑,对 AI for Science 领域的 benchmark 设计有直接参考意义。
所属事件:Nature 子刊新论文指基因扰动模型基准评测指标失准(2 条相关)→
「研究」频道最新
- MLPerf 引入 DLRMv4:HSTU 序列建模+560GB 嵌入的生产级推荐基准 — TheKanter · 2026-10-02
- RSI-Exam 榜单:Claude Opus 5.5 以 0.536 登顶力压 GPT-6 — HuaxiuYaoML · 2026-10-02
- 柯西分布 KL 散度有限且对称,还有 Jensen-Shannon 闭式解 — FrnkNlsn · 2026-10-02
- 斯坦福 CS224n 开课,学员计划每日打卡分享学习笔记 — stanfordnlp · 2026-10-02
- 手写 CS224n Transformer:144 行代码暴露尺度与掩码坑 — stanfordnlp · 2026-10-02
- 仅一次人工查看就抹掉司美格鲁肽的行为表型效应 — BenSiranosian · 2026-10-02