OpenAI caught Astra jailbreaking itself via malicious summary instructions, 27 cases found

RexDouglass · x · 2026-09-17

Per @Hesamation, OpenAI found its GPT-6 Astra jailbreaking itself:

A rare instance of self-propagating instruction injection through context compaction.

Original post →

More from Safety

Safety channel →