专题 · FULL STORY
GPT-6 Astra的MazeBench实测风波
博主用自建3D空间推理基准MazeBench实测GPT-6 Astra,首轮60小时仅得14%,随后补充实验发现代码执行工具能显著提升其3D空间推理表现,评测结论逐步演进。
2026-09-07 ~ 2026-09-14 · 2 集 · 14 条
第 1 集 · GPT-6 Astra 跑 3D 评测 MazeBench 60 小时仅得 14%(2026-09-07,8 条)
博主 patiencecave 用自建的 3D 开放世界空间推理评测 MazeBench 测试 GPT-6 Astra:模型运行超过 60 小时,在不使用代码执行的条件下仅得 14%,但已是该评测迄今最强表现,高于带 Python 代码执行的 GPT-5.6 Sol 的 13%,博主据此认为体现了能力的代际跃升;不过距离通过 MazeBench 更难的挑战仍有很大差距。转发该结果的 Andrew Curran 表示关注,Rohan Paul 指出这一成绩约为对比模型 Claude Fable 5.1 的 7 倍。另有 Reddit 用户 WonderfulBuffalo32 贴出 GPT Astra 在无任何工具设置下于 MazeBench 仅得 13% 的评测截图,认为迷宫类空间推理表现远低于预期,与官方 demos 呈现的能力形成明显反差。
已确认
- MazeBench 为长程空间推理评测:200+ 房间中隐藏 100 颗宝石,要求 agent 旋转视角、操纵箱子、从错误中恢复,并执行可能超过 100 步的计划;无 Python 赛道更难,因能用代码的 agent 可逆向求解。
- 为节省 token,评测允许 GPT-6 Astra 每回合批量提交走法而非逐步走子;模型随即稳定地提前规划 10-20 步,把原本约 30 亿 token 的消耗压缩到 3.5 亿。
- Astra 表现超越此前所有 agent,可轻松解决需要同时处理 5 个移动部件的谜题(如华容道类谜题);探索热力图显示其探索范围远超对比模型 Fable 5.1。
- 失败模式分析显示,Astra 倾向于把关卡当作俯视 2D 平面来理解,把只有 3D 视角才能看到的墙当成隐形屏障;它能完成教学关,但无法通过物体堆叠超过 3 层的 3D 谜题。
尚未确认
- Reddit 帖子称无工具裸跑得 13%,与 patiencecave 报告的 14% 略有出入,两者评测细节是否完全一致暂无交叉验证。
为什么重要
即便是最强的新一代模型,在长时程、真 3D 空间推理上仍存在结构性短板,「俯视图式」世界理解仍是当前模型的瓶颈;同时批量规划带来的 token 消耗骤降,也展示了 agent 评测设计对成本的显著影响。
- GPT-6 Astra 跑 60 小时 3D 空间推理评测,仅得 14 分 — patience_cave · 2026-09-07
- GPT-6 Astra 超越以往所有 agent,能同时处理 5 个动态要素 — patience_cave · 2026-09-07
- GPT-6 难以理解 3D 世界:只按俯视图推演,3 层以上堆叠即卡关 — patience_cave · 2026-09-07
- 允许批量走子后,GPT-6 把 30 亿 token 压到 3.5 亿 — patience_cave · 2026-09-07
- GPT-6 不用代码执行(14%)仍胜过带 Python 的 GPT-5.6(13%) — patience_cave · 2026-09-07
- GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡 — Wonderful_Buffalo_32 · 2026-09-07
- GPT-6 Astra 跑 MazeBench 空间推理评测:耗时 60 小时仅得 14% — basedjensen · 2026-09-07
- GPT-6 Astra 无代码跑 MazeBench 拿 14%,达 Claude Fable 5.1 的 7 倍 — rohanpaul_ai · 2026-09-08
第 2 集 · MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(2026-09-14,6 条)
博主 patiencecave 用自建的 3D 空间推理基准 MazeBench 对 GPT-6「Astra」进行了系统实测,核心结论是:代码执行工具对该模型的空间推理提升显著,且 Astra 即使不带工具也超过了上一代 GPT-5.6「Sol」带工具的成绩。
已确认
- MazeBench 是一个在 3D 开放世界中测试视觉空间推理的迷宫基准,作者为 patiencecave。
- GPT-6 Astra 配合 Python 代码执行,在消耗 4 亿 token、推理 24 小时后最终得分 23%;不用 Python 时得分降至 14%。
- 带代码执行时,Astra 轻松解出所有入门关卡,单次思考很少超过 5 分钟;无工具时平均每次规划要花 9 分钟,有时超过 20 分钟。
- 横评显示:Astra 带代码执行的分数相比 GPT-5.6 Sol 带代码执行近乎翻倍;更值得注意的是,Astra 不用代码执行的裸跑成绩也超过了带工具的 GPT-5.6 Sol。
为什么重要
- 结果表明代码工具能大幅降低规划成本:据 patiencecave 的转述,用工具规划可省约一半成本并换来约 60% 的提升。
- Astra 裸跑即胜过上一代带工具的表现,说明 GPT-6 的「世界模型」与原生空间推理能力有代际提升,这对评估新一代模型的真实能力具有参考价值。
- GPT-6 Astra 跑 MazeBench:4 亿 token 24 小时推理仅得 23% — patience_cave · 2026-09-14
- GPT-6 Astra 带代码执行解 3D 关卡,规划时间从 20 分钟缩到 5 分钟内 — patience_cave · 2026-09-14
- Astra 3D 空间推理实测:用工具规划省一半成本换 60% 提升 — patience_cave · 2026-09-14
- MazeBench 横评:GPT-6 Astra 裸跑已胜过 GPT-5.6 Sol 带工具 — patience_cave · 2026-09-14
- Maze Bench 3D 基准曝光:GPT-6 Astra 不用代码也胜 GPT-5.6 用代码 — patience_cave · 2026-09-14
- MazeBench 实测:模型推理 4 亿 token、24 小时仅得 23 分 — mhmazur · 2026-09-14