John Langford: turn HF-hack-related systems into model honeypots, audit-based safety is unreliable

JohnCLangford · x · 2026-09-11

Veteran ML researcher John Langford argues on model safety:

Related event: Langford warns malicious models can reinterpret benign tokens(2 posts)→

Original post →

More from Safety

Safety channel →