新基准 DiG-bench 发布:前沿模型在发现任务上仍被简单问题难倒

misovalko · x · 2026-08-14

普林斯顿、MIT、KAUST 等机构联合发布新基准 DiG-bench,用于测试 AI 模型的科学发现能力。该基准通过文本游戏环境,让模型通过实验发现未知规则,而非仅应用已知知识。测试发现,前沿模型在过去几个月进步显著,但仍被一些简单问题难住,即使在文本领域。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →