DiG-bench基准发布:前沿大模型仍难解简单文本探索题

普林斯顿、MIT等机构联合发布了DiG-bench(Discovery Games Benchmark),一个包含70个纯文本交互游戏的新基准,专门测试大语言模型的科学发现与规则探索能力。测试表明,尽管前沿模型近期能力显著提升,但在面对极其简单的纯文本探索问题时依然表现不佳,暴露了AI在核心推理上的短板。

已确认

为什么重要

2026-08-12 ~ 2026-08-12 · 12 条相关

一手来源

另有 4 条近重复转述:jcrwhittington · jcrwhittington · jcrwhittington · misovalko