3D 空间推理 MazeBench 榜单:Opus 5.5 得 6%,GPT-6 Sol 仅 1%

daniel_mac8 · x · 2026-09-23

博主转发讨论了 3D 空间推理基准 MazeBench 的最新成绩:Opus 5.5 得分 6%,被认为正逐步逼近 Astra 的水平;而 GPT-6 Sol 与 Grok 4.7 在这个高难度基准上都只有 1%。发帖人还提到某模型"比 Fable 5.1 好 3 倍"的说法。上述模型与基准名称未经官方证实,成绩真实性存疑,建议以官方评测为准。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →