DiG-bench:评估前沿大模型「发现能力」的文本基准

AndrewLampinen · x · 2026-08-12

回复了关于新基准测试 DiG-bench 的讨论。原帖指出,DiG-bench 是一个全新的发现能力基准,它通过纯文本环境下的“发现游戏”来测试前沿 AI 模型,从而排除了视觉理解的干扰。回复者则针对原帖中提到的“每个游戏至少被一名人类首次尝试就攻破”这一细节,进一步追问了人类的尝试次数(pass at K)以及测试人群的来源。

所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →