MazeBench 最新成绩:一众旗舰模型迷宫任务得分为零

patience_cave · x · 2026-08-24

MazeBench 发布新一轮结果:ox-alpha、Grok 4.6、GLM-5.3、Qwen 3.8-max 在迷宫任务上全部得 0%;Gemini 3.7 Flash 拿到 1%,反而超过了 Kimi K3。显示当前前沿模型在结构化空间推理(迷宫求解)上整体表现仍然极差。

所属事件:MazeBench 迷宫评测:多数旗舰模型得分为零(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →