DiG-bench基准测试:前沿大模型仍被简单文本探索题难倒

jcrwhittington · x · 2026-08-12

研究团队发布了 DiG-bench,这是一个包含 70 个纯文本交互游戏的全新基准测试,旨在评估大语言模型的科学发现与规则探索能力。

测试结果表明,尽管前沿模型的能力在过去几个月有显著提升,但面对一些极其简单的文本探索问题时依然会卡壳。在原生文本领域,模型的探索能力仍有很大瓶颈。

所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →