MazeBench发布:长时序Agent挑战,无Python仅1%
新评测环境 MazeBench 旨在测试 Agent 在 3D 开放世界中的长时规划与视觉空间推理能力,环境包含推箱子谜题、电梯、冰面等机制且无难度上限。测试结果显示,不使用 Python 的 Agent 成功率仅约 1%。针对排行榜是否只测前沿模型默认 harness 的质疑,作者回应称代码与所有关卡完全开源,任意模型搭配任意 harness 均可参赛挑战。
2026-08-21 ~ 2026-08-21 · 2 条相关
- MazeBench 评测发布:长时序 Agent 挑战,无 Python 仅 1% — JFPuget · 2026-08-21
- MazeBench 完全开源:任意模型配任意 harness 均可参赛挑战 — xeophon · 2026-08-21