新基准DiG-bench发布:前沿模型在简单发现任务上仍会卡壳

AccBalanced · x · 2026-08-13

普林斯顿、MIT等机构联合推出新基准DiG-bench,用于测试AI模型的发现能力。该基准采用纯文本环境,避免视觉干扰。测试发现,前沿模型虽在近几个月进步显著,但在一些简单问题上仍会失败。

所属事件:DiG-bench发布:70个文本游戏揭示大模型科学发现短板(14 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →