GPT-6 Astra tops GDP.pdf benchmark at 33.2%, beating Claude Fable 5.1
ArtificialAnlys · x · 2026-09-05
Artificial Analysis published full GDP.pdf results: OpenAI's GPT-6 Astra leads at 33.2%, followed by GPT-5.6 Sol at 28.2%, with Anthropic's Claude Fable 5.1 at 26.2%.
Created by @HelloSurgeAI, GDP.pdf evaluates single-turn professional document reasoning across 100 PDFs in ten domains. Models must synthesize evidence spread across 4,592 pages—text, tables, charts, footnotes and exclusions—with responses graded against 1,275 expert criteria.
More from Models
- Dev Notes GPT-6 Astra Still Needs Babysitting, Makes Wrong Calls on Physics Engine Changes — yacineMTB · 2026-09-05
- GPT-6 Astra One-Shots a 3D Game in 45 Minutes; Dev Shares Image-Gen Trick for Better Graphics — Scobleizer · 2026-09-05
- Not one negative post about Astra: OpenAI's best release ever? — kimmonismus · 2026-09-05
- Follow-up on unverified 'Astra' demo: 'it even has a back panel' — adonis_singh · 2026-09-05
- Blogger claims unverified 'Astra' model left him speechless, pits 'Claude Fable 5' vs 'GPT-5.5' — adonis_singh · 2026-09-05
- GPT-6 Astra One-Shots 3D in Blender via Computer Use, Prompt Included — Scobleizer · 2026-09-05