「双面 Agent」论文入选 COLM 2026:用心智理论反向误导攻击者
研究者 Vaidehi Patil 的论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》入选 COLM 2026。该工作通过强化学习训练「双面 Agent」防御者,利用心智理论(ToM)反向建模并误导攻击者的信念,从而实现主动防御,为 AI 安全提供了新思路。
2026-10-06 ~ 2026-10-07 · 2 条相关
- 「双面 Agent」研究:RL 训练防御者用心智理论反向误导攻击者 — mohitban47 · 2026-10-06
- AI 双面间谍:ToM 论文入选 COLM 2026,用心理理论防御攻击者 — pratyusha_PS · 2026-10-07