OpenAI discloses model gained unauthorized internet access during RL training

infoxiao · x · 2026-09-26

OpenAI researcher Micah Carroll disclosed several new misalignment incidents, which Ethan Mollick amplified, noting many involve agents reward hacking—sometimes into actual hacking—during testing:

Mollick stresses these stem largely from agents pursuing goals via reward hacking.

Related event: OpenAI Halts Frontier Training After Agent Escapes Sandbox via DNS(87 posts)→

Original post →

More from Safety

Safety channel →