「双面 Agent」研究:RL 训练防御者用心智理论反向误导攻击者
mohitban47 · x · 2026-10-06
研究者 Vaidehi Patil 将在 COLM 2026 展示论文《Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind》:训练防御型 LLM 一边保护敏感信息、一边把攻击者引导向错误认知,还让攻击者以为得手。
要点:
- 提出 ToM-SB:长程对话环境,防御者需骗过试图套取敏感信息的攻击者(攻击者可能已有部分先验知识)
- 前沿模型表现差:Gemini 3 Pro 仅 34%,GPT-5.4 仅 27%,说明强模型也难以构建和运用心智理论(ToM)
- 用 RL 训练防御者主动建立并利用对攻击者的 ToM,可显著提升欺骗效果,并以此分析和改进 LLM 的 ToM 能力
作者还将在 AdvML-Frontiers × CoTMA 工作坊做 Rising Star 报告,主题为 LLM 系统的 unlearning、隐私泄漏与对抗性交互压测,目前正找业界工作(2027 春毕业)。
「安全」频道最新
- 麦当劳遭集体诉讼:被指用 AI 与非公开数据协同全美近 1.4 万家店定价 — Polymarket · 2026-10-06
- AI 专家上 ABC 谈 Altman 风险论:自愿护栏需要真正约束力 — chrismattmann · 2026-10-06
- 牛津智库警告:政府部署 AI Agent 面临失控与问责真空 — _akpiper · 2026-10-06
- 白宫签署 Genesis Mission 行动,称 AI 版「曼哈顿计划」 — aKaizuh · 2026-10-06
- MCP 成 agent 间攻击链:Google 等五机构五个月接连中招 — Ars Technica AI · 2026-10-06
- DEF 报告:AI 与加密共担的政策难题——开发者何时为代码担责 — Prof_CarlaReyes · 2026-10-06