「双面 Agent」论文入选 COLM 2026:用心智理论反向误导攻击者

研究者 Vaidehi Patil 的论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》入选 COLM 2026。该工作通过强化学习训练「双面 Agent」防御者,利用心智理论(ToM)反向建模并误导攻击者的信念,从而实现主动防御,为 AI 安全提供了新思路。

2026-10-06 ~ 2026-10-07 · 2 条相关