DiG-bench 揭示:顶尖模型在简单发现游戏中仅胜 20%
misovalko · x · 2026-08-15
普林斯顿与 MIT 等机构联合发布了 DiG-bench,一个用于测试 AI 发现能力的新基准。该基准采用基于文本的发现游戏,直接在语言模型的 native domain 进行测试,避免了视觉理解的干扰。结果显示,虽然前沿模型在过去几个月进步显著,但在面对一些意想不到的简单问题时依然束手无策——人类能首次尝试通关,表现最好的模型通关率仅 20%。研究还发现,所谓的 agentic harnesses(智能体框架)相较于基础方案并未带来提升。
所属事件:DiG-bench发布:前沿模型简单发现任务胜率仅20%(2 条相关)→
「研究」频道最新
- 数学家用 AI 找到 30 年前猜想反例 — skdh · 2026-08-15
- 谷歌开源同态加密编译器,密文推理成为现实 — DynamicWebPaige · 2026-08-15
- 学术圈激辩:论文评审能否使用 AI 及其披露规范 — lpachter · 2026-08-15
- Claude 数日解决随机热力学开放问题 — lpachter · 2026-08-15
- GPU竞赛:紧凑Householder QR内核实现232倍加速 — petrusenko_max · 2026-08-15
- Scale AI 论文:41 种智能体故障模式,定位失败根源新分类法 — rohanpaul_ai · 2026-08-15