GPT-6 Astra 跑 MazeBench:4 亿 token 24 小时推理仅得 23%

patience_cave · x · 2026-09-14

博主 patiencecave 用自建的 3D 迷宫基准 MazeBench 测试 GPT-6「Astra」+Python 代码执行:消耗 4 亿 token、推理 24 小时后最终得分仅 23%;不用 Python 时得分降到 14%。

作者观察:Astra 能理解从拱门下走过等空间概念,但隧道变长后就「不敢盲飞」,3D 空间推理仍有很大提升空间。

所属事件:MazeBench 实测 GPT-6 Astra:4 亿 token 24 小时仅得 23%(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →