MazeBench Released: Open-Source 3D Maze Benchmark for Long-Range Planning
MazeBench 正式开源发布,这是一个基于 JavaScript 引擎构建的 3D 开放世界解谜基准,专门用于评测智能体的长程规划、视觉空间推理以及持续学习能力。作者指出,当前表现最好的智能体在面对该基准的挑战时,依然只能通过最初几层。
已确认
- MazeBench 是一个开源的本地浏览器应用,提供可交互的游玩界面、排行榜和存档能力,并在同一个 JavaScript 引擎中评测编码智能体。
- 基准环境包含 200 多个房间和谜题,其中 100 多个房间由作者家人协助设计。
- 评测强调分布外(OOD)难度和持续学习:部分关卡需要智能体控制摄像头,且存在跨关卡复用的技巧,要求模型具备跨关卡学习的能力。
- 为防止智能体在长任务中陷入死循环浪费算力,基准引入了 novelty score 机制:智能体可运行大约 O(M) tokens,但若系统判断其在原地绕圈则会强行终止。
- 该项目获得了 Prime Intellect 的赞助以及相关导师的指导。
为什么重要
- 传统基准多为静态问答集,而 MazeBench 提供了一个动态的、具有极高难度的 3D 交互环境,直接暴露了当前顶级智能体在复杂空间导航和长程规划上的严重短板,为未来的智能体研究指明了新的突破方向。
2026-07-28 ~ 2026-07-28 · 8 related posts
Primary sources
- MazeBench is a 3D benchmark that leaves today’s agents stuck in the opening rooms — patience_cave · 2026-07-28
- [source] MazeBench opens a 3D puzzle benchmark for coding agents with 200+ rooms — patience_cave · 2026-07-28
- MazeBench launches as an open-source 3D puzzle benchmark for agent evaluation — patience_cave · 2026-07-28
- [source] MazeBench adds novelty-based loop stopping to keep long runs from wasting compute — xeophon · 2026-07-28
- MazeBench turns maze solving into a continual-learning benchmark with camera control — xeophon · 2026-07-28
- MazeBench launches as an open-source 3D spatial reasoning benchmark — patience_cave · 2026-07-28
- Mazebench goes open source with 100+ designed rooms and a blog release — patience_cave · 2026-07-28
1 near-duplicate retellings: teortaxesTex