全新 DiG-bench 基准测试发布:揭示前沿大模型仍败于简单文本推理

misovalko · x · 2026-08-12

来自普林斯顿、MIT 等机构的研究团队推出了 DiG-bench(Discovery in Games),一个全新的基于文本的上下文发现能力基准测试。

测试机制

核心发现

所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →