研究发现:均值基线在约95%情况下击败 AI 生物基准评分
bravo_abad · x · 2026-10-07
Miller 等人发现,用于细胞基因表达预测的 AI benchmark 可能漏掉它本应检测的生物学信号。
- 实验设计:对接受同一基因干预的细胞分两组,用一组的平均基因表达谱预测另一组。理论上两组都应包含 AI 要学习的响应信号。
- 关键发现:在一个数据集中,完全忽略干预信息的朴素均值基线,在约 95% 的情况下用 MSE 评分胜过真实信号。
- 原因:大多数基因对干预几乎无响应,合并大量细胞能更精确估计基本不变的背景表达;当误差跨基因平均时,低噪背景的优势盖过了捕捉真实响应的价值。
- 解决方案:研究者构建了将观测响应与稳定均值结合的阳性对照,以检验评分规则,并提出加权 MSE,对有变化证据的基因给予更高权重。
结论:AI for biology 的评测指标本身可能系统性地奖励'预测平均值',掩盖真实的干预效应。
「研究」频道最新
- OpenAI 模型给出平面色数证明,求解法简化或成下一个方向 — yacinelearning · 2026-10-07
- TaylorSeer 与 KV 缓存叠加会明显损伤图像生成质量 — RisingSayak · 2026-10-07
- KV 缓存叠加传统扩散加速反掉质量,作者补做对照实验 — RisingSayak · 2026-10-07
- Flux.2-Klein-KV 疑可对文本投影做 KV 缓存,输出未见失败 — RisingSayak · 2026-10-07
- 流模型 KV 缓存长文 benchmark 侧重速度-内存权衡 — RisingSayak · 2026-10-07
- KV Caching 首次系统迁移到图像扩散模型,附实现与基准测试 — RisingSayak · 2026-10-07