AI 双面间谍:ToM 论文入选 COLM 2026,用心理理论防御攻击者

pratyusha_PS · x · 2026-10-07

论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》被 COLM 2026 接收(10 月 6-9 日,旧金山)。作者 will be at the conference。

核心思路:与其硬拦恶意攻击者,不如让防御 agent 主动「配合演出」——用 attacker 的心智理论(ToM)判断对方已知信息,给出看似合理却误导性的答案,让攻击者误以为得手而不再进攻。防御者既不能露馅(要估计对方已知什么),又不能泄露新信息。团队为此提出了 AI Double Agents 概念和 ToM-SB 新任务。

所属事件:「双面 Agent」论文入选 COLM 2026:用心智理论反向误导攻击者(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →