MazeBench 最新成绩:一众旗舰模型迷宫任务得分为零
patience_cave · x · 2026-08-24
MazeBench 发布新一轮结果:ox-alpha、Grok 4.6、GLM-5.3、Qwen 3.8-max 在迷宫任务上全部得 0%;Gemini 3.7 Flash 拿到 1%,反而超过了 Kimi K3。显示当前前沿模型在结构化空间推理(迷宫求解)上整体表现仍然极差。
所属事件:MazeBench 迷宫评测:多数旗舰模型得分为零(2 条相关)→
「模型」频道最新
- Qwen3.8-27B 登顶 WebDev 排行榜细分领域前八 — arena · 2026-08-25
- Qwen3.8-27B 登顶 Code Arena 综合第九 — arena · 2026-08-25
- OpenAI 超快推理模式被指将成默认,反驳“小众”说法 — GavinSBaker · 2026-08-24
- 神秘模型 Ox Alpha 疑似基于 GLM:同 tokenizer 且带视觉 — samuel-christlie · 2026-08-24
- 调遍参数也压不住:Qwen3.8-27B 沉迷输出大段叙述 — norenEnmotalen · 2026-08-24
- 6000 次抽水果实验:ChatGPT 随机选择随语言剧烈变化 — Raffallos · 2026-08-24