DiG-bench测试:闭源模型大幅领先,Agent框架未提升发现能力

jcrwhittington · x · 2026-08-12

研究团队公布了模型在 DiG-bench 基准上的具体表现:

所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →