DiG-bench发布:前沿模型简单发现任务胜率仅20%

普林斯顿、MIT、KAUST等机构联合发布科学发现基准DiG-bench,以文本游戏环境让模型通过实验发现未知规则,而非套用已知知识。测试显示,顶尖前沿模型在最简单的发现游戏中胜率仅约20%,暴露出当前AI在真正科学发现能力上的显著短板。

2026-08-14 ~ 2026-08-15 · 2 条相关

另有 1 条近重复转述:misovalko