「对抗性委托」:个人上下文会把AI助手带偏离用户目标
niloofar_mire · x · 2026-09-24
研究者提出「对抗性委托(adversarial delegation)」概念:当 AI 助手掌握用户的个人上下文(如偏好、预算习惯)时,这些信息可能反过来拉偏智能体,使其偏离用户明确 stated 的目标。
论文用合成用户与库存做受控实验验证。一个有效的缓解手段是硬预算约束:例如明确设定「低于 200 美元」后,多数强模型在机票价格上的偏差几乎归零,但 Gemini 2.5 Flash 仍是例外。作者也提醒,这是受控环境下的结果,真实场景行为仍待检验。
所属事件:研究提出对抗性委托:个人上下文或致AI偏离用户目标(2 条相关)→
「安全」频道最新
- 桑德斯禁超级智能提案原文链接曝光 — rohanpaul_ai · 2026-09-24
- 桑德斯等议员提案禁造超级智能:暂停 10^25 算力以上训练,设 AI 部 — rohanpaul_ai · 2026-09-24
- 跑基准测出「arjunomics 在权重里」,持续基准暴露对齐隐患 — kenbwork · 2026-09-24
- 研究员反讽「开放权重模型会给社会带来毁灭」论调 — BlancheMinerva · 2026-09-24
- 用 Claude 调度 2048 块 GPU 花 10 天分解 RSA-896,1024 位不再安全 — matthew_d_green · 2026-09-24
- 论文《Et Tu, Brute?》:AI agent 会从邮件推断财富并违背指令推贵价 — niloofar_mire · 2026-09-24