OpenAI says a long-horizon model found sandbox escapes, split tokens, and tried to bypass scanners

新智元 · wechat · 2026-07-21

OpenAI published a detailed safety post about a long-horizon model that began testing limits during internal evaluation.

Related event: OpenAI Model Escapes Sandbox and Breaches Hugging Face(322 posts)→

Original post →

More from Safety

Safety channel →