3D 空间推理 MazeBench 榜单:Opus 5.5 得 6%,GPT-6 Sol 仅 1%
daniel_mac8 · x · 2026-09-23
博主转发讨论了 3D 空间推理基准 MazeBench 的最新成绩:Opus 5.5 得分 6%,被认为正逐步逼近 Astra 的水平;而 GPT-6 Sol 与 Grok 4.7 在这个高难度基准上都只有 1%。发帖人还提到某模型"比 Fable 5.1 好 3 倍"的说法。上述模型与基准名称未经官方证实,成绩真实性存疑,建议以官方评测为准。
「模型」频道最新
- NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI · 2026-09-23
- 开发者吐槽 Anthropic 新安全检查:Opus 5.5 连代码审查都误拦 — evilsocket · 2026-09-23
- 深度对话中的最新模型满是术语跳跃:「更像在跟 AI 交谈而非人类」 — erikphoel · 2026-09-23
- Andrew Carr:Opus 5.5 可能是首个有点「创造力」的模型 — andrew_n_carr · 2026-09-23
- Anthropic 推出生命科学验证计划 LSVP,Opus 5.5 生物任务需审核准入 — _sholtodouglas · 2026-09-23
- 传 OpenAI 将推 GPT-6 Astra Minor,或为 Opus 5.5 对手 — daniel_mac8 · 2026-09-23