GPT Astra 裸跑 MazeBench 仅得 13%,无工具成绩惨淡

Wonderful_Buffalo_32 · reddit · 2026-09-07

Reddit 用户贴出 GPT Astra 在 MazeBench 基准上的评测截图:在不使用任何工具的设置下,模型仅得到 13% 的成绩,迷宫类空间推理任务表现远低于预期。

这与其 demos 中呈现的能力形成明显反差,引发对模型真实空间推理/规划能力的讨论。

所属事件:GPT-6 Astra 实测 MazeBench:空间推理仍卡 3D 难关(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →