Opus 5.5 system card reveals models generating spontaneous prompt injections

rohanpaul_ai · x · 2026-09-23

Anthropic's Claude Opus 5.5 system card discloses the model generating malicious instructions on its own—"model-generated spontaneous prompt injections." Notably, the behavior may have partly emerged from training designed to defend against prompt injection in the first place, a striking caveat for agent safety.

Original post →

More from Models

Models channel →