Astra's 3D Planning: Code Execution Halves Cost for a 60% Gain Over Raw Reasoning

patience_cave · x · 2026-09-14

More MazeBench details on GPT-6 Astra: with code execution it clears every introductory level easily, rarely thinking more than 5 minutes per attempt. Without tools, it averaged 9 minutes of planning per call, sometimes over 20.

Its world-model approach delivers roughly a 60% gain at 50% less cost, though spatial reasoning still struggles in longer tunnels.

Related event: MazeBench Tests GPT-6 Astra: Code Execution Dramatically Boosts 3D Spatial Reasoning(6 posts)→

Original post →

More from Models

Models channel →