MazeBench 实测:模型推理 4 亿 token、24 小时仅得 23 分

mhmazur · x · 2026-09-14

MazeBench 作者发布对 GPT-6 Astra 的 3D 迷宫环境实测:消耗 4 亿 token、推理 24 小时后最终得分仅 23%;而不用 Python 工具时得分只有 14%,说明代码工具对该模型在此类空间推理任务上提升显著。mhmazur 等人对该基准与分析表示赞赏。

所属事件:MazeBench 实测 GPT-6 Astra:代码工具显著提升 3D 空间推理(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →