System card data contradicts OpenAI's Astra alignment claim, critic says GPT-5.5 safer
GarrisonLovely · x · 2026-09-04
OpenAI claims Astra is its "most aligned model," but Tim Hua disputes this using the system card itself: on internal deployment simulation evals, Astra's "circumventing restrictions" rate is 38% of GPT-5.6-sol's, while GPT-5.5's is only 10% — suggesting GPT-5.5 is likely more aligned and that the system card doesn't support OpenAI's claim.
Related event: Researchers Challenge OpenAI's Claims That Astra Is Its Most Aligned Model(4 posts)→
More from Models
- OpenAI's Astra can now layout and route PCBs, sparking hardware engineering debate — MikePFrank · 2026-09-04
- Ethan Mollick: Astra just takes action, spinning up agents on vague requests — emollick · 2026-09-04
- 'AGI is 74% deepswe': GPT-6-Astra benchmark results become an AI-circle meme — amaarora · 2026-09-04
- Grok 4.7 reportedly days away, trained on SpaceX engineering data; Grok 4.6 already ties GPT-6 Astra at 61 — XFreeze · 2026-09-04
- Ex-OpenAI safety lead Miles Brundage: if your primary emotion on AI isn't concern, you're misreading it — Miles_Brundage · 2026-09-04
- Gary Marcus on GPT-6 Astra: symbolic world models are vindication, but no proof of AGI — GaryMarcus · 2026-09-04