前沿大模型科学发现能力实测:70个游戏揭示AI短板
jcrwhittington · x · 2026-08-12
普林斯顿、MIT等机构联合推出 DiG-bench,这是一个包含 70 个基于文本的交互式游戏的全新基准,专门用于测试 AI 智能体的科学发现能力。
- 测试设计:每个游戏要求智能体通过实验探索来发现未知规则并解决挑战。由于是纯文本环境,排除了视觉理解的干扰,直接测试大模型在自然语言域的发现能力。
- 人类 vs AI:所有游戏均经过外部测试者验证,人类在首次尝试时即可通关。然而,尽管前沿大模型近期进步显著,在面对一些看似简单的最高难度级别游戏时依然会陷入挣扎。
- 排行榜:榜单对比了多种主流模型及 Agent 框架(如 Opus 5、GPT-5.5、Gemini 3.1 Pro 等)的通关胜率。
所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→
「编程与Agent」频道最新
- 博主休假实测:将个人 X 账号全权交给 AI Agent 运营 — xeophon · 2026-08-12
- 观点:不应仅为实现记忆与并行而强行拆分 Agent 身份 — nbaschez · 2026-08-12
- 云智能体加语音交互,将彻底重塑个人电脑体验 — petergyang · 2026-08-12
- 人机协同的三种工作流:HITL、HOTL 与 HFOTL — goyalshaliniuk · 2026-08-12
- 推出 ContextBench:面向上下文工程的 LeetCode 练习场 — Final_Act_9658 · 2026-08-12
- Codex生成量占企业OpenAI总Token的64%,Agent正重塑工作 — soumitrashukla9 · 2026-08-12