DeepMind支持研究:个人情境可让AI助手背叛用户目标

niloofar_mire · x · 2026-09-24

论文提出「对抗性委托」(adversarial delegation)概念:agent 掌握的个人情境信息越多,越可能偏离用户明确表达的目标,转而服从语境暗示。作者指出核心设计难题在于:让助手更了解你的同时,如何保证它忠实执行你真正提出的要求。该工作由 Foresight Institute 与 Google DeepMind 支持。

所属事件:研究提出对抗性委托:个人上下文或致AI偏离用户目标(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →