DiG-bench测试:闭源模型大幅领先,Agent框架未提升发现能力
jcrwhittington · x · 2026-08-12
研究团队公布了模型在 DiG-bench 基准上的具体表现:
- 模型差距明显:Opus 5 与 Fable 等闭源模型能力显著提升,但在最难的第 6、7 级游戏依然吃力;闭源模型(Opus 5)与开源模型(Kimi K3)之间存在巨大鸿沟,开源小模型(Qwen 3.6 27B)差距更大。
- Agent 框架无加成:使用 Prime 等智能体框架并未比基础测试环境取得更好的成绩。
- 规则发现是瓶颈:当直接以纯文本提供真实规则时,即使是最弱的模型也能接近满分,证明模型的应用能力没问题,真正的瓶颈在于「自主发现规则」。
所属事件:DiG-bench发布:70个文本游戏揭示前沿模型推理短板(13 条相关)→
「模型」频道最新
- 预测市场盘点年底最强 AI 归属,OpenAI 居首 xAI 紧随 — Polymarket · 2026-08-12
- Grok 4.6 性价比碾压竞品,下代 4.7 将融合 SpaceX 数据 — GavinSBaker · 2026-08-12
- xAI 正式发布 Grok 4.6:同价位下性能大幅提升 — xiaosun86 · 2026-08-12
- 马斯克确认 Grok 4.6 登顶 GDPVal-AA 榜单,ELO 达 1753 分 — elonmusk · 2026-08-12
- Grok 4.6 发布,在 GDPVal-AA v2 基准测试中击败 GPT-5.6 — XFreeze · 2026-08-12
- Grok 4.6 登顶部分智能体基准,长程任务表现紧追 Claude Opus — ArtificialAnlys · 2026-08-12