Double-Agent Defender Paper Using Theory of Mind Accepted at COLM 2026
A COLM 2026 paper by Vaidehi Patil introduces a double-agent defender trained with RL that uses Theory of Mind to model and mislead attackers' beliefs, offering a new approach to AI security.
2026-10-06 ~ 2026-10-07 · 2 related posts
- Double-Agent LLM Defenders: RL-Trained Theory of Mind Fools Attackers, Frontier Models Score Only 27-34% — mohitban47 · 2026-10-06
- AI Double Agents: ToM-based defense paper accepted at COLM 2026 — pratyusha_PS · 2026-10-07