Epoch AI Launches New Game Puzzles Benchmark to Test LLM Reasoning

Jsevillamol · x · 2026-08-07

Epoch AI has launched a new "game puzzles" benchmark designed to evaluate LLM reasoning capabilities. Similar to their Chess Puzzles benchmark, it uses puzzles from an undisclosed game to test models on reasoning-heavy tasks where they likely weren't specifically post-trained. The current record holder is Claude 3 Opus, scoring 59%.

Original post →

More from Models

Models channel →