3D 空间推理基准 MazeBench:Opus 5.5 得 6%,GPT-6 Sol 仅 1%

patience_cave · x · 2026-09-23

博主用自建的 3D 空间推理基准 MazeBench 测试各家前沿模型:Opus 5.5 得分 6%,正逐步逼近「Astra」水平;GPT-6 Sol 与 Grok 4.7 则都只有 1%。结果显示顶级模型在 3D 空间推理这类任务上仍远未过关,彼此差距也很大。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →