「双面 Agent」研究:RL 训练防御者用心智理论反向误导攻击者

mohitban47 · x · 2026-10-06

研究者 Vaidehi Patil 将在 COLM 2026 展示论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》:训练防御型 LLM 一边保护敏感信息、一边把攻击者引导向错误认知,还让攻击者以为得手。

要点:

作者还将在 AdvML-Frontiers × CoTMA 工作坊做 Rising Star 报告,主题为 LLM 系统的 unlearning、隐私泄漏与对抗性交互压测,目前正找业界工作(2027 春毕业)。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →