AI 双面间谍:ToM 论文入选 COLM 2026,用心理理论防御攻击者
pratyusha_PS · x · 2026-10-07
论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》被 COLM 2026 接收(10 月 6-9 日,旧金山)。作者 will be at the conference。
核心思路:与其硬拦恶意攻击者,不如让防御 agent 主动「配合演出」——用 attacker 的心智理论(ToM)判断对方已知信息,给出看似合理却误导性的答案,让攻击者误以为得手而不再进攻。防御者既不能露馅(要估计对方已知什么),又不能泄露新信息。团队为此提出了 AI Double Agents 概念和 ToM-SB 新任务。
所属事件:「双面 Agent」论文入选 COLM 2026:用心智理论反向误导攻击者(2 条相关)→
「研究」频道最新
- AI 数学证明走向开源式协作:方格装箱证明附可视化讲解 — ctjlewis · 2026-10-07
- 开源平台 Overmind:用生产轨迹持续训练与改进 AI Agent — cneuralnetwork · 2026-10-07
- 研究发现:top-k logits 泄露的信息量与 tuned lens 相当 — sineadwilliamso · 2026-10-07
- AutoAWQ 作者:约 4.3 万美元和一个 B300 节点四周可复现 Bonsai 2 — airesearch12 · 2026-10-07
- COLM 2026 新研究:下游任务早接触统一安全预训练视角 — AdtRaghunathan · 2026-10-07
- SWE Decision Index v0.3 发布:私有关卡+视觉评测防刷榜 — multimodalart · 2026-10-07