MazeBench results: flagship models score 0% on maze tasks

patience_cave · x · 2026-08-24

New MazeBench results are in: ox-alpha, Grok 4.6, GLM-5.3, and Qwen 3.8-max all score 0% on maze-solving tasks; Gemini 3.7 Flash manages 1% and beats Kimi K3. The takeaway: frontier models remain collectively terrible at structured spatial reasoning.

Related event: MazeBench: Most Flagship Models Score Zero on Maze Tasks(3 posts)→

Original post →

More from Models

Models channel →