BALROG 基准:前沿 LLM 五年仍难通关 NetHack,进度仅 13%
_rockt · x · 2026-09-22
- Tim Rocktäschel 提到,NetHack Learning Environment 自 2020 年存在,游戏智能体基准 BALROG 自 2024 年起用它评测前沿 LLM/VLM 的 agentic 能力,虽有进展但 NetHack 仍远未解决。
- 排行榜关键数据(截至 2026-09):GPT-6-Astra-Max 综合领先,NetHack 进度 13.2%(BabaIsAI 100%、MiniHack 100%、Crafter 76.8%);Claude-Opus-5-Max NetHack 仅 7.3%;GPT-5.6-Terra-Max 3.3%。
- 历史对比:2024 年底的 Claude-Opus-4.5 在 NetHack 上只有 2.0-2.4%,DeepSeek-R1 为 1.4%,Grok-4 为 1.8%——两年间最强模型从个位数进步到 13%,说明长程探索类游戏对 LLM 仍是硬骨头。
- 仓库提供全部漏洞式复现、参数与伪代码(指该 benchmark 的提交与榜单体系)。
「模型」频道最新
- Grok 4.7 曝光:开源世界城市游戏对比显示远强于 4.6 — belce_dogru · 2026-09-22
- tiny 分类模型 Jev 对打 Claude 全家桶:自测文本理解不落下风 — vesko_st · 2026-09-22
- 自建防背诵基准实测:微型分类模型 Jev 达 Sonnet 水平、便宜约 150 倍 — vesko_st · 2026-09-22
- HLE 榜单:Grok 4.7 居第 21,Gemini 3.8 与 Muse 1.3 领跑 — himanshustwts · 2026-09-22
- Grok 4.7 编码实测翻车:Terminal-Bench 4.0 成绩难看 — daniel_mac8 · 2026-09-22
- Grok 4.7 上线 Vercel AI Gateway:50 万上下文,9 月 27 日前 6 折 — cramforce · 2026-09-22