GPT-6 Astra jumps 42.2pp to top Terminal-Bench-Science at 64.6%
BenBlaiszik · x · 2026-09-04
Just one week after launch, Terminal-Bench-Science 0.1 became the #1 featured benchmark in OpenAI's GPT-6 Astra release: GPT-5.6 Sol scored 22.4% while GPT-6 Astra hit 64.6%—a +42.2pp jump, on top of Claude Fable 5.1 numbers from two days earlier. The team is calling on scientists to contribute tougher challenges for Terminal-Bench-Science 0.2, deadline October 5.
Related event: GPT-6 Astra Sets New Records on ECI and Terminal-Bench-Science(6 posts)→
More from Models
- Users burned rate limits expecting GPT-6 Astra reset, but launch slipped to Friday — BLUECOW009 · 2026-09-04
- OpenAI ships GPT-6 Astra, first model to trigger internal safety measures, billed as AGI — ShakeelHashim · 2026-09-04
- OpenAI unveils GPT-6 Astra: an agent that can do anything on your computer — AndrewSchmidtFC · 2026-09-04
- GPT-6 Astra tops Zapier's AutomationBench at 41.4%, first model ever to clear 40% — sandersted · 2026-09-04
- Podcast preview: Peter Gostev shares more GPT-6 Astra experiments on ThursdAI — altryne · 2026-09-04
- Astra solves a FrontierMath prototype problem for $161.84 + $1,874.64 in tokens — mobav0 · 2026-09-04