OpenAI Quietly Altered GPT-6 Astra Benchmark Scores: Fortune
Fortune reported that OpenAI quietly edited multiple benchmark figures around GPT-6 Astra's launch, in some cases improving Astra's numbers while downgrading competitor Anthropic's. The hallucination rate reportedly changed from 4.2% to 2% at one point, raising transparency concerns.
2026-09-05 ~ 2026-09-05 · 3 related posts
- Episode 1: OpenAI Launches GPT-6 Astra: Premium-Priced Flagship with Long-Horizon Agents and Safety Controversies(2026-09-04, 189 posts)
- Episode 2: GPT-6 Astra Saturates ARC-AGI-3 as Zero-Reasoning-Token Results Spark Implicit Reasoning Debate(2026-09-04, 10 posts)
- Episode 3: OpenAI Engineer: Token-Based Pricing Is Broken, Cost Should Be Measured Per Task(2026-09-04, 4 posts)
- Episode 4: GPT-6 Astra's Token Efficiency Emerges as Hidden Advantage(2026-09-05, 3 posts)
- Episode 5: User Tests Show GPT-6 Astra Outshines GPT-5.6 Sol(2026-09-05, 3 posts)
- Episode 6: OpenAI Quietly Altered GPT-6 Astra Benchmark Scores: Fortune(2026-09-05, 3 posts)
- Episode 7: Users Report GPT-6 Astra Hits New SOTA in Agentic CAD(2026-09-05, 2 posts)
- OpenAI quietly boosted GPT-6 Astra benchmark numbers and kept changing them after launch, Fortune reports — jeremyakahn · 2026-09-05
- OpenAI quietly changed GPT-6 Astra benchmark results around launch, Fortune reports — mark_k · 2026-09-05
1 near-duplicate retellings: mark_k