DiG-bench 揭示:顶尖模型在简单发现游戏中仅胜 20%

misovalko · x · 2026-08-15

普林斯顿与 MIT 等机构联合发布了 DiG-bench,一个用于测试 AI 发现能力的新基准。该基准采用基于文本的发现游戏,直接在语言模型的 native domain 进行测试,避免了视觉理解的干扰。结果显示,虽然前沿模型在过去几个月进步显著,但在面对一些意想不到的简单问题时依然束手无策——人类能首次尝试通关,表现最好的模型通关率仅 20%。研究还发现,所谓的 agentic harnesses(智能体框架)相较于基础方案并未带来提升。

所属事件:DiG-bench发布:前沿模型简单发现任务胜率仅20%(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →