MazeBench: Most Flagship Models Score Zero on Maze Tasks
MazeBench's latest results show flagship models like Grok 4.6, GLM-5.3 and Qwen 3.8-max all scoring 0% on maze tasks, with Gemini 3.7 Flash leading at just 1%.
2026-08-24 ~ 2026-08-25 · 3 related posts
- MazeBench results: flagship models score 0% on maze tasks — patience_cave · 2026-08-24
- MazeBench update: Gemini 3.7 Flash scores 1% to lead — SimplyAnnisa · 2026-08-24
- MazeBench Update: Grok explores most, Gemini Flash solves puzzles while others struggle with T-shaped blocks — patience_cave · 2026-08-25