Steganography pioneer John Langford skeptical of AI safety auditing: models can reinterpret benign tokens arbitrarily

JohnCLangford · x · 2026-09-11

John Langford argues that safety-by-auditing was likely never reasonable, since a malicious model could reinterpret seemingly-benign tokens in arbitrary ways. He also notes that in their experience at least some 3-pass training is needed. He cites his 2002 CRYPTO paper with Hopper and von Ahn, 'Provably Secure Steganography,' which proved that one-way functions imply computationally secure steganographic protocols — a theoretical foundation for why hidden channels in model outputs may be undetectable.

Related event: Langford warns malicious models can reinterpret benign tokens(2 posts)→

Original post →

More from Safety

Safety channel →