新基准 DiG-bench 发布:前沿模型在发现任务上仍被简单问题难倒
misovalko · x · 2026-08-14
普林斯顿、MIT、KAUST 等机构联合发布新基准 DiG-bench,用于测试 AI 模型的科学发现能力。该基准通过文本游戏环境,让模型通过实验发现未知规则,而非仅应用已知知识。测试发现,前沿模型在过去几个月进步显著,但仍被一些简单问题难住,即使在文本领域。
「研究」频道最新
- UHAS:统一手部动作空间实现跨具身灵巧操作 — chris_j_paxton · 2026-08-14
- 研究生证明分形不确定性原理,量子混沌研究里程碑 — MacrinePhD · 2026-08-14
- 数学家批评将开放问题转为AI基准:失去教育意义 — rbhar90 · 2026-08-14
- UP2You:无需微调,从照片快速重建你的 3D 模型 — tom_doerr · 2026-08-14
- Abaka AI赞助EMNLP DocInsights研讨会,设$5k+奖金挑战赛 — keviv9 · 2026-08-14
- 新论文:在预训练阶段注入合成道德反思,3B模型价值观显著改变 — sethlazar · 2026-08-14