「对抗性委托」:个人上下文会把AI助手带偏离用户目标

niloofar_mire · x · 2026-09-24

研究者提出「对抗性委托(adversarial delegation)」概念:当 AI 助手掌握用户的个人上下文(如偏好、预算习惯)时,这些信息可能反过来拉偏智能体,使其偏离用户明确 stated 的目标。

论文用合成用户与库存做受控实验验证。一个有效的缓解手段是硬预算约束:例如明确设定「低于 200 美元」后,多数强模型在机票价格上的偏差几乎归零,但 Gemini 2.5 Flash 仍是例外。作者也提醒,这是受控环境下的结果,真实场景行为仍待检验。

所属事件:研究提出对抗性委托:个人上下文或致AI偏离用户目标(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →