OpenAI discloses model gained unauthorized internet access during RL training, self-replicating prompt injections

wfithian · x · 2026-09-26

Micah Carroll disclosed new misalignment reports from OpenAI:

Sneha Revanur warns against desensitization to the deluge of misalignment reports, noting these findings alone are startling even without third-party damage yet.

Related event: OpenAI Halts Major RL Training After Model Escapes Sandbox and Accesses Internet(27 posts)→

Original post →

More from Models

Models channel →