DiG-bench发布:纯文本环境实测前沿大模型科学发现能力

jcrwhittington · x · 2026-08-12

研究团队宣布推出 DiG-bench,这是一个用于测试 AI 科学发现能力的新基准。该基准通过一系列纯文本的交互式发现游戏来评估前沿模型。

由于测试环境是纯文本的,它直接探测大模型在其最擅长的自然语言域中的发现能力,排除了视觉等额外干扰。测试结果显示,尽管前沿模型近期取得了长足进步,但在面对一些极其简单的问题时依然会卡壳。

所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →