The AI Safety Paradox: Adversarial Training Data as a Trojan Horse

alexbilz · x · 2026-08-11

Security researchers point out that adversaries could craft deliberately naïve-looking jailbreak prompts for red-teaming datasets while secretly embedding steganographic payloads. This creates a paradox: efforts to strengthen AI safety via adversarial training data could become the trojan horse itself.

Original post →

More from Safety

Safety channel →