GPT-6 Astra 无代码跑 MazeBench 拿 14%,达 Claude Fable 5.1 的 7 倍
rohanpaul_ai · x · 2026-09-08
- MazeBench 是一个长程空间推理评测:在 200+ 房间中隐藏 100 颗宝石,要求 agent 旋转视角、操纵箱子、从错误中恢复,并执行可能超过 100 步的计划。
- 无 Python 赛道更难:能用代码的 agent 可以逆向物理引擎、跑求解算法,而不必自己承担完整空间规划。GPT-6 Astra 在该赛道拿到 14%,是 Claude Fable 5.1(2%)的 7 倍。
- 据帖子描述,Astra 在这个 3D 开放世界评测上耗时 60+ 小时,显示出能将长计划保持在脑内并自主执行;剩余失败集中在真正 3D 的谜题上,说明提升主要在持续规划而非完全的空间理解。
- 注意:该评测与分数来自个人推文,属第三方说法,暂无官方确认。
所属事件:GPT-6 Astra 跑60小时3D推理仅得14%(8 条相关)→
「模型」频道最新
- 网友指控 OpenAI 向知名数学家施压要求配合造假被拒 — S_Conradi · 2026-09-09
- Vercel 开源 gpu-lexer:27.5KB 小模型靠 WebGPU 在浏览器猜代码语法 — shadcn · 2026-09-09
- Magic 公布下一步路线:长上下文 RL、潜在知识对齐,之后发布模型 — magicailabs · 2026-09-09
- 45 万美元训练出前沿级法律模型 Thomson,数据策展成关键杠杆 — schwarzjn_ · 2026-09-09
- 爆料称 Anthropic 将在 9 月底 IPO 前发布 Fable 级新预训练模型 — teortaxesTex · 2026-09-09
- 网友称 GPT-6 Astra 跨领域通用性跃升,堪比 AGI — brandon_galang · 2026-09-09