MazeBench 用 3D 开放世界测智能体,现有模型只到开局
patience_cave · x · 2026-07-28
- MazeBench 是一个用于评测长程规划和视觉空间推理的 3D 开放世界基准。
- 它包含数百个房间和谜题,作者表示当前最好的 agent 也过不了最初几层。
- 补充说明里提到,agent 需要穿过 200 多个房间,通过类似 Sokoban 的推箱子谜题找到 100 个隐藏宝石,而且难度增长很快。
- 团队还用模型原生 harness 加上摄像头和角色控制工具做了测试;无论输入是图像、ASCII 还是 JSON,表现都很差,最高只有 1%。
- 为了防止模型原地打转,他们还用了 novelty score 来在出现循环行为时提前停止。
所属事件:MazeBench发布3D评测基准,现有AI智能体卡在开局(2 条相关)→
「编程与Agent」频道最新
- AI工具Robin将暗网调研缩短至30分钟 — tom_doerr · 2026-07-28
- Excel+LLM 系统的瓶颈是业务知识无损传递 — Tired40s · 2026-07-28
- 四个模型同题做游戏,Opus 5 像完整成品 — victor_explore · 2026-07-28
- 生产级 agent 需要结构化评测流水线 — blaizedsouza · 2026-07-28
- 重试 agent 步骤,不等于安全恢复 14 步工作流 — msignificantdigit · 2026-07-28
- 长跑 Agent 的上下文管理只有三种解法 — blaizedsouza · 2026-07-28