MazeBench 评测发布:长时序 Agent 挑战,无 Python 仅 1%
JFPuget · x · 2026-08-21
MazeBench 是一个新的评测环境,旨在测试 Agent 在 3D 开放世界中的长时规划和视觉空间推理能力。环境包含推箱子谜题、电梯、冰面等机制,且没有难度上限。测试结果显示,如果不使用 Python 工具,所有模型得分均低于 1%;启用 Python 后,GPT-5.6 Sol、Fable 5 和 Opus 5 等前沿模型得分约为 10%。
所属事件:MazeBench发布:长时序Agent挑战,无Python仅1%(2 条相关)→
「研究」频道最新
- QuoteBench:相同分数可能掩盖执行边界解析失败 — Shangao Li · 2026-08-21
- Lightwheel开源10万小时第一视角数据集,覆盖1.5万种任务 — lukas_m_ziegler · 2026-08-21
- 长周期Agent技术入门:从秒级到小时级任务 — agihouse_org · 2026-08-21
- poolside 研究员对谈:数万次数据配比实验如何推动模型前沿 — arena · 2026-08-21
- Google 开源 TIPSv2 图文编码器,零样本分割四榜全 SOTA — bdsqlsz · 2026-08-21
- 开源 WBC-Mjlab 登陆 mjswan 云端,浏览器试玩 Unitree G1 全身控制 — kevin_zakka · 2026-08-21