DiG-bench:70 个文字探索游戏测试 AI 的科学发现能力
jcrwhittington · x · 2026-08-12
为了让 AI 真正具备科学发现能力,而不仅仅是组合现有工具,研究人员推出了 DiG-bench——一个包含 70 个手工制作的文字探索游戏基准测试集。
- 游戏机制:每个游戏都是一个独立的世界,规则和获胜条件被隐藏,AI 必须通过真实的实验和探索来发现。
- 难度分级:设有七个难度等级,专门针对前沿大模型进行校准。游戏具有挑战性但可通关,每个游戏至少有一名人类在首次尝试时成功通关。
- 数据划分:21 个游戏公开,其余 49 个保持私有以确保安全评估的准确性。
所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→
「研究」频道最新
- VIScore:诊断潜在世界模型规划质量的新指标 — DrMorganLevine · 2026-08-13
- 伯克利峰会分享:构建物理世界的 AI 联合科学家 — yuqirose · 2026-08-13
- 实验揭示Adam破坏低秩偏差,Muon在低尾能量处表现优异 — EtherealGlyph · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 前高管反思 LLM 泛化神话:通用智能只是数据堆砌的错觉 — joshua_saxe · 2026-08-13
- Sara Hooker 谈无梯度持续学习与 AI 算力民主化 — AI Engineer · 2026-08-13