3D 空间推理基准 MazeBench:Opus 5.5 得 6%,GPT-6 Sol 仅 1%
patience_cave · x · 2026-09-23
博主用自建的 3D 空间推理基准 MazeBench 测试各家前沿模型:Opus 5.5 得分 6%,正逐步逼近「Astra」水平;GPT-6 Sol 与 Grok 4.7 则都只有 1%。结果显示顶级模型在 3D 空间推理这类任务上仍远未过关,彼此差距也很大。
「模型」频道最新
- NVIDIA 发布 Nemotron 3 说话人分离模型,支持 8 人重叠语音 — NVIDIAAI · 2026-09-23
- 开发者吐槽 Anthropic 新安全检查:Opus 5.5 连代码审查都误拦 — evilsocket · 2026-09-23
- 深度对话中的最新模型满是术语跳跃:「更像在跟 AI 交谈而非人类」 — erikphoel · 2026-09-23
- Andrew Carr:Opus 5.5 可能是首个有点「创造力」的模型 — andrew_n_carr · 2026-09-23
- Anthropic 推出生命科学验证计划 LSVP,Opus 5.5 生物任务需审核准入 — _sholtodouglas · 2026-09-23
- 传 OpenAI 将推 GPT-6 Astra Minor,或为 Opus 5.5 对手 — daniel_mac8 · 2026-09-23