MazeBench 评测发布:长时序 Agent 挑战,无 Python 仅 1%

JFPuget · x · 2026-08-21

MazeBench 是一个新的评测环境,旨在测试 Agent 在 3D 开放世界中的长时规划和视觉空间推理能力。环境包含推箱子谜题、电梯、冰面等机制,且没有难度上限。测试结果显示,如果不使用 Python 工具,所有模型得分均低于 1%;启用 Python 后,GPT-5.6 Sol、Fable 5 和 Opus 5 等前沿模型得分约为 10%。

所属事件:MazeBench发布:长时序Agent挑战,无Python仅1%(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →