MazeBench 发布 3D 长程规划评测,当前最佳 agent 仍卡在起始关
teortaxesTex · x · 2026-07-28
MazeBench 是一个新的 3D 开放世界评测基准,专门用来考察 agent 的长程规划和视觉空间推理能力。
- 整个环境包含数百个房间和谜题,强调 OOD(分布外)测试难度。
- 作者表示,目前最好的 agent 即使有 Python 访问权限,也还无法推进到初始关卡之后。
- 这个基准的设计目标是:人类可通关,但对当前 agent 很难,用来检验长期规划能力的上限。
所属事件:MazeBench 开源发布:3D 迷宫评测长程规划(8 条相关)→
「研究」频道最新
- Muse Spark 1.1 在 Arena 视觉前沿分数升至 1283 — arena · 2026-07-28
- Laguna 24 小时内快了 36.8%,基准校验也在加固 — gajesh · 2026-07-28
- MazeBench 用 3D 开放世界考长期规划,顶级 agent 还过不了前几关 — JasonBotterill · 2026-07-28
- Lean 4 形式化出 block sensitivity 与 spectral sensitivity 的 2.12+ 分离 — RexDouglass · 2026-07-28
- 会议审稿人失责导致论文只剩两份审稿意见 — CSProfKGD · 2026-07-28
- GBAG-Bench 发现本地 BI 模型会写对 SQL 也会瞎报增长 — Additional_Menu8542 · 2026-07-28