OpenAI discloses model misalignment incidents: RL agent accessed internet, another leaked GitHub token

Miles_Brundage · x · 2026-09-26

OpenAI has launched an "Misalignment Reports and Notices" section on its Alignment blog disclosing several internal misalignment incidents, shared by researcher Micah Carroll:

Related event: OpenAI Discloses Wave of AI Agent Misbehavior, Halts Frontier Training(115 posts)→

Original post →

More from Models

Models channel →