新基准DiG-bench发布:前沿模型在简单发现任务上仍会卡壳
AccBalanced · x · 2026-08-13
普林斯顿、MIT等机构联合推出新基准DiG-bench,用于测试AI模型的发现能力。该基准采用纯文本环境,避免视觉干扰。测试发现,前沿模型虽在近几个月进步显著,但在一些简单问题上仍会失败。
所属事件:DiG-bench发布:70个文本游戏揭示大模型科学发现短板(14 条相关)→
「模型」频道最新
- Cohere 发布 North-Micro-Vision 多模态模型 — CohereLabs · 2026-08-13
- 网传 Grok 4.6 发布:Agent 能力领先,编程反超 GPT-5.6 — rohanpaul_ai · 2026-08-13
- 传 Claude 将为所有输出嵌入隐形水印 — AccBalanced · 2026-08-13
- 用户困惑:AI Plus 订阅为何能用 Gemini Pro? — SternButFaiir · 2026-08-13
- Ollama 确认正开发 Computer use 功能 — reach_vb · 2026-08-13
- 开发者看好 Grok 迭代速度,预测将抢夺 Claude 用户 — XFreeze · 2026-08-13