GPT-6 Astra 实测 MazeBench:空间推理仍卡 3D 难关

博主 patiencecave 用自建的 3D 开放世界空间推理评测 MazeBench 测试「GPT-6 Astra」:模型在该评测上运行超过 60 小时,最终仅得 14%。尽管绝对分数偏低,这已是 MazeBench 上迄今最强的表现,且是在不使用代码执行的条件下取得的,高于带 Python 代码执行的 GPT-5.6 Sol 的 13%,博主据此认为这体现了能力的代际跃升。另有 Reddit 用户贴出 GPT Astra 在无任何工具设置下于 MazeBench 仅得 13% 的评测截图,认为迷宫类空间推理表现远低于预期,与官方 demos 呈现的能力形成明显反差。

已确认

尚未确认

为什么重要

即便是最强的新一代模型,在长时程、真 3D 空间推理上仍存在结构性短板,说明「俯视图式」世界理解仍是当前模型的瓶颈;同时批量规划能力带来的 token 消耗骤降,也展示了 agent 评测设计对成本的影响。博主指出,距离通过 MazeBench 更难的挑战仍有很大差距。

2026-09-07 ~ 2026-09-07 · 7 条相关

一手来源

另有 1 条近重复转述:basedjensen