前沿大模型仍解不开简单谜题?DiG-bench 发布 70 个科学发现测试

jcrwhittington · x · 2026-08-12

研究团队发布了 DiG-bench,一个专门测试大语言模型「科学发现能力」的新基准。它包含 70 个纯文本交互游戏,要求模型通过实验探索来发现隐藏规则并通关。

由于环境是纯文本,排除了视觉理解的干扰,能精准测试模型在母语域的发现能力。测试表明,尽管前沿模型近期进步显著,但在面对一些人类首次尝试就能解开的简单问题时依然会卡壳。

所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →