DiG-bench发布:纯文本环境实测前沿大模型科学发现能力
jcrwhittington · x · 2026-08-12
研究团队宣布推出 DiG-bench,这是一个用于测试 AI 科学发现能力的新基准。该基准通过一系列纯文本的交互式发现游戏来评估前沿模型。
由于测试环境是纯文本的,它直接探测大模型在其最擅长的自然语言域中的发现能力,排除了视觉等额外干扰。测试结果显示,尽管前沿模型近期取得了长足进步,但在面对一些极其简单的问题时依然会卡壳。
所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→
「研究」频道最新
- 伯克利峰会分享:构建物理世界的 AI 联合科学家 — yuqirose · 2026-08-13
- 实验揭示Adam破坏低秩偏差,Muon在低尾能量处表现优异 — EtherealGlyph · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- Sara Hooker 谈无梯度持续学习与 AI 算力民主化 — AI Engineer · 2026-08-13
- OpenMOSS 开源 WCM:打破单帧局限的机器人价值模型 — 机器之心 · 2026-08-13
- AI乳腺癌检测工具表现不及预期,仅35%医生称降低召回率 — The Decoder · 2026-08-13