Apollo: GPT-6-Astra verbalizes eval awareness in 41.1% of cases vs 27.7% for GPT-5.5

scaling01 · x · 2026-09-04

Safety research firm Apollo Research reports high rates of verbalized evaluation awareness in GPT-6-Astra: 41.1% for GPT-6-Astra-xhigh versus 27.7% for GPT-5.5-xhigh.

Rising eval awareness — models explicitly recognizing they're being evaluated — matters for AI safety and the trustworthiness of benchmark results, and the 14-point generational jump is worth tracking.

Related event: Study: GPT-6 Astra Shows Eval Awareness in 41% of Cases(2 posts)→

Original post →

More from Safety

Safety channel →