70个隐藏规则文字游戏:全新AI探索发现基准 DiG-bench
jcrwhittington · x · 2026-08-12
为评估 AI 在未知环境中的真实探索与科学发现能力,研究者推出了 DiG-bench 基准。该基准包含 70 个独立的文字探索游戏,每个游戏都构建为一个极简的字符串世界(例如玩家以箭头形式在其中“行走”)。
核心特点如下:
- 隐藏规则:游戏的操作方式与胜利条件均未公开,AI 必须通过纯粹的实验和试错来摸索机制。
- 难度分级:设定了 7 个难度梯队,专门针对当前前沿大模型进行校准。游戏极具挑战性,但保证有解(每个游戏至少有一名人类能在首次尝试时通关)。
- 安全评测:21 个游戏公开,其余 49 个保持私密,以确保模型评估的安全性与防作弊。
作者指出,AI 若要在未来真正实现科学发现,而非仅仅组合现有工具,必须先证明其能在最基础的设定中完成“发现”任务。
所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→
「研究」频道最新
- VIScore:诊断潜在世界模型规划质量的新指标 — DrMorganLevine · 2026-08-13
- 伯克利峰会分享:构建物理世界的 AI 联合科学家 — yuqirose · 2026-08-13
- 实验揭示Adam破坏低秩偏差,Muon在低尾能量处表现优异 — EtherealGlyph · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 前高管反思 LLM 泛化神话:通用智能只是数据堆砌的错觉 — joshua_saxe · 2026-08-13
- Sara Hooker 谈无梯度持续学习与 AI 算力民主化 — AI Engineer · 2026-08-13