GPT-6 Astra 实测 MazeBench:空间推理仍卡 3D 难关
博主 patiencecave 用自建的 3D 开放世界空间推理评测 MazeBench 测试「GPT-6 Astra」:模型在该评测上运行超过 60 小时,最终仅得 14%。尽管绝对分数偏低,这已是 MazeBench 上迄今最强的表现,且是在不使用代码执行的条件下取得的,高于带 Python 代码执行的 GPT-5.6 Sol 的 13%,博主据此认为这体现了能力的代际跃升。另有 Reddit 用户贴出 GPT Astra 在无任何工具设置下于 MazeBench 仅得 13% 的评测截图,认为迷宫类空间推理表现远低于预期,与官方 demos 呈现的能力形成明显反差。
已确认
- 为节省 token,评测允许 GPT-6 Astra 每回合批量提交走法而非逐步走子;模型随即稳定地提前规划 10-20 步,把原本约 30 亿 token 的消耗压缩到 3.5 亿。
- Astra 表现超越此前所有 agent,可轻松解决需要同时处理 5 个移动部件的谜题(如华容道类谜题);探索热力图显示其探索范围远超对比模型 Fable 5.1。
- 失败模式分析显示,Astra 倾向于把关卡当作俯视 2D 平面来理解,把只有 3D 视角才能看到的墙当成隐形屏障;它能完成教学关,但无法通过物体堆叠超过 3 层的 3D 谜题。
尚未确认
- Reddit 帖子称无工具裸跑得 13%,与 patiencecave 报告的 14% 略有出入,两者评测细节是否完全一致暂无交叉验证。
为什么重要
即便是最强的新一代模型,在长时程、真 3D 空间推理上仍存在结构性短板,说明「俯视图式」世界理解仍是当前模型的瓶颈;同时批量规划能力带来的 token 消耗骤降,也展示了 agent 评测设计对成本的影响。博主指出,距离通过 MazeBench 更难的挑战仍有很大差距。
2026-09-07 ~ 2026-09-07 · 7 条相关
一手来源
- GPT-6 Astra 跑 60 小时 3D 空间推理评测,仅得 14 分 — patience_cave ·
- GPT-6 不用代码执行(14%)仍胜过带 Python 的 GPT-5.6(13%) — patience_cave ·
- GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡 — Wonderful_Buffalo_32 ·
- 【源头】GPT-6 Astra 跑 60 小时 3D 空间推理评测,仅得 14 分 — patience_cave · 2026-09-07
- GPT-6 Astra 超越以往所有 agent,能同时处理 5 个动态要素 — patience_cave · 2026-09-07
- GPT-6 难以理解 3D 世界:只按俯视图推演,3 层以上堆叠即卡关 — patience_cave · 2026-09-07
- 允许批量走子后,GPT-6 把 30 亿 token 压到 3.5 亿 — patience_cave · 2026-09-07
- 【源头】GPT-6 不用代码执行(14%)仍胜过带 Python 的 GPT-5.6(13%) — patience_cave · 2026-09-07
- 【源头】GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡 — Wonderful_Buffalo_32 · 2026-09-07
另有 1 条近重复转述:basedjensen