斯坦福学者警告:BioReason benchmark 存在信息泄露,别再用了
anshulkundaje · x · 2026-10-03
斯坦福教授 Anshul Kundaje 指出,所谓「多模态生物学推理模型」实际上名不副实;其配套的 BioReason benchmark 在任务定义上有严重问题,且 prompt 中存在信息泄露。他明确建议不要再用这些任务做 benchmark 或在其任务定义上继续构建工作。
所属事件:斯坦福教授 Kundaje 炮轰 AI×Bio 乱象与 NeurIPS 评审(11 条相关)→
「研究」频道最新
- 数学博士转向训练 AI 解公开难题,已在算术物理取得进展 — shuchaobi · 2026-10-03
- childes-db 2026 版发布:儿童语言转录库扩至 2420 万句话 — najoungkim · 2026-10-03
- 终端 Agent 训练项目 SETA 入选 NeurIPS,开源 4500+ 可验证 RL 环境 — Thom_Wolf · 2026-10-03
- MedARC 期刊俱乐部:颅内脑电基础模型预训练研究分享 — iScienceLuvr · 2026-10-03
- Mosaic:扩散语言模型精确约束解码框架,登 NeurIPS — StefanoErmon · 2026-10-03
- NYU研究质疑Anthropic结论:LLM内省证据不足 — tallinzen · 2026-10-03