DiG-bench发布:70个文本游戏评估AI科学发现能力
jcrwhittington · x · 2026-08-12
研究团队正式发布了 DiG-bench(Discovery Games Benchmark),这是一个旨在测试 AI 科学发现能力的基准测试。
核心设计:
- 包含 70 个全新的交互式纯文本游戏,要求智能体通过实验发现每个游戏的未知规则并加以应用。
- 纯文本环境排除了视觉等干扰因素,直接测试大语言模型在原生域的探索发现能力。
- 人类与前沿模型在完全相同的界面、操作集和步骤限制下进行测试。
测试结论:
- 游戏分为 7 个难度等级,所有游戏人类首次尝试即可通关,但最好的 AI 模型在最高难度下依然挣扎。
- 闭源模型(如 Opus 5)表现远超开源模型(如 Kimi K3)。
所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→
「研究」频道最新
- 图解 AI 数学能力进展:解决 Erdős 问题成本逼近千万美元 — ajeya_cotra · 2026-08-12
- ApexFold:根据化学环境预测多肽二级结构 — KevinKaichuang · 2026-08-12
- 研究揭示人类与猕猴视觉皮层共享高维物体空间 — martin_hebart · 2026-08-12
- Physical Intelligence 联创:机器人正进入 GPT 时代 — Y Combinator · 2026-08-12
- Engram深度解析:为何私有数据上的大模型训练会崩溃 — AI Engineer · 2026-08-12
- 实测 Gemma 4 QAT:KV Cache 量化表现大幅提升 — Anbeeld · 2026-08-12