DiG-bench发布:前沿模型简单发现任务胜率仅20%
普林斯顿、MIT、KAUST等机构联合发布科学发现基准DiG-bench,以文本游戏环境让模型通过实验发现未知规则,而非套用已知知识。测试显示,顶尖前沿模型在最简单的发现游戏中胜率仅约20%,暴露出当前AI在真正科学发现能力上的显著短板。
2026-08-14 ~ 2026-08-15 · 2 条相关
- 新基准 DiG-bench 发布:前沿模型在发现任务上仍被简单问题难倒 — misovalko · 2026-08-14
另有 1 条近重复转述:misovalko