MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理
博主 patiencecave 用自建的 3D 空间推理基准 MazeBench 对 GPT-6「Astra」进行了系统实测,核心结论是:代码执行工具对该模型的空间推理提升显著,且 Astra 即使不带工具也超过了上一代 GPT-5.6「Sol」带工具的成绩。
已确认
- MazeBench 是一个在 3D 开放世界中测试视觉空间推理的迷宫基准,作者为 patiencecave。
- GPT-6 Astra 配合 Python 代码执行,在消耗 4 亿 token、推理 24 小时后最终得分 23%;不用 Python 时得分降至 14%。
- 带代码执行时,Astra 轻松解出所有入门关卡,单次思考很少超过 5 分钟;无工具时平均每次规划要花 9 分钟,有时超过 20 分钟。
- 横评显示:Astra 带代码执行的分数相比 GPT-5.6 Sol 带代码执行近乎翻倍;更值得注意的是,Astra 不用代码执行的裸跑成绩也超过了带工具的 GPT-5.6 Sol。
为什么重要
- 结果表明代码工具能大幅降低规划成本:据 patiencecave 的转述,用工具规划可省约一半成本并换来约 60% 的提升。
- Astra 裸跑即胜过上一代带工具的表现,说明 GPT-6 的「世界模型」与原生空间推理能力有代际提升,这对评估新一代模型的真实能力具有参考价值。
2026-09-14 ~ 2026-09-14 · 6 条相关
- 第 1 集:GPT-6 Astra 跑 3D 评测 MazeBench 60 小时仅得 14%(2026-09-07,8 条)
- 第 2 集:MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(2026-09-14,6 条)
一手来源
- GPT-6 Astra 跑 MazeBench:4 亿 token 24 小时推理仅得 23% — patience_cave ·
- Astra 3D 空间推理实测:用工具规划省一半成本换 60% 提升 — patience_cave ·
- MazeBench 横评:GPT-6 Astra 裸跑已胜过 GPT-5.6 Sol 带工具 — patience_cave ·
- 【源头】GPT-6 Astra 跑 MazeBench:4 亿 token 24 小时推理仅得 23% — patience_cave · 2026-09-14
- GPT-6 Astra 带代码执行解 3D 关卡,规划时间从 20 分钟缩到 5 分钟内 — patience_cave · 2026-09-14
- 【源头】Astra 3D 空间推理实测:用工具规划省一半成本换 60% 提升 — patience_cave · 2026-09-14
- 【源头】MazeBench 横评:GPT-6 Astra 裸跑已胜过 GPT-5.6 Sol 带工具 — patience_cave · 2026-09-14
- Maze Bench 3D 基准曝光:GPT-6 Astra 不用代码也胜 GPT-5.6 用代码 — patience_cave · 2026-09-14
另有 1 条近重复转述:mhmazur