前沿大模型仍解不开简单谜题?DiG-bench 发布 70 个科学发现测试
jcrwhittington · x · 2026-08-12
研究团队发布了 DiG-bench,一个专门测试大语言模型「科学发现能力」的新基准。它包含 70 个纯文本交互游戏,要求模型通过实验探索来发现隐藏规则并通关。
由于环境是纯文本,排除了视觉理解的干扰,能精准测试模型在母语域的发现能力。测试表明,尽管前沿模型近期进步显著,但在面对一些人类首次尝试就能解开的简单问题时依然会卡壳。
所属事件:DiG-bench基准发布:前沿大模型仍难解简单文本探索题(12 条相关)→
「研究」频道最新
- EpochAI又一开放难题被攻破,神秘大佬再次破解 — rickasaurus · 2026-08-12
- 哈佛论文:分配角色改变临床 AI 智能体的医疗资源分配行为 — zakkohane · 2026-08-12
- LLM 思维链不可靠?研究者呼吁深挖潜在空间计算 — ricklamers · 2026-08-12
- 打破部署即停滞僵局:超 20 家初创押注大模型持续学习 — bigdata · 2026-08-12
- 解析长任务训练崩溃:自蒸馏为何优于GRPO与RLHF — AI Engineer · 2026-08-12
- 推出 ContextBench:面向上下文工程的 LeetCode 练习场 — Final_Act_9658 · 2026-08-12