DiG-bench基准测试:前沿大模型仍被简单文本探索题难倒
jcrwhittington · x · 2026-08-12
研究团队发布了 DiG-bench,这是一个包含 70 个纯文本交互游戏的全新基准测试,旨在评估大语言模型的科学发现与规则探索能力。
测试结果表明,尽管前沿模型的能力在过去几个月有显著提升,但面对一些极其简单的文本探索问题时依然会卡壳。在原生文本领域,模型的探索能力仍有很大瓶颈。
所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→
「研究」频道最新
- 机器人遥操作系统的核心:数据质量重于硬件 — stepjamUK · 2026-08-12
- Keras 后端无关性优势:Expedia 大规模模型摆脱 TF 锁定 — fchollet · 2026-08-12
- MatrAIx 推出 83 亿人格代理,构建数字产品模拟评测基础设施 — EricTopol · 2026-08-12
- 单细胞生物学先驱Arjun Raj出任Cellular Intelligence首席科学家 — arjunrajlab · 2026-08-12
- 深度学习仍存基础盲区:直到 2021 年才攻克单个带偏置神经元动力学 — orvieto_antonio · 2026-08-12
- EpochAI又一开放难题被攻破,神秘大佬再次破解 — rickasaurus · 2026-08-12