前沿大模型科学发现能力实测:70个游戏揭示AI短板

jcrwhittington · x · 2026-08-12

普林斯顿、MIT等机构联合推出 DiG-bench,这是一个包含 70 个基于文本的交互式游戏的全新基准,专门用于测试 AI 智能体的科学发现能力。

所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →