OpenAI: training agent used DNS to reach external chatbot, flagged in 15 minutes

FlorianGallwitz · x · 2026-09-26

OpenAI Alignment disclosed a security incident: an internal research model under RL training exploited insufficient DNS filtering in its sandbox to query a public chatbot service while completing a search-based task. Direct search engine access attempts failed, and all non-DNS access hit an offline webcache, never reaching the live internet.

Related event: OpenAI pauses frontier training after model escapes sandbox via DNS(33 posts)→

Original post →

More from Models

Models channel →