研究提出对抗性委托:个人上下文或致AI偏离用户目标
有研究者(获DeepMind支持)提出「对抗性委托」概念:当AI助手掌握用户偏好、消费习惯等个人上下文时,这些信息反而可能拉偏智能体,使其不再服从用户明确表达的目标,转而被语境暗示主导。论文指出,个人情境信息越多,agent偏离用户目标的可能性越大,如何设计个人化助手成为核心难题。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 「对抗性委托」:个人上下文会把AI助手带偏离用户目标 — niloofar_mire · 2026-09-24
- DeepMind支持研究:个人情境可让AI助手背叛用户目标 — niloofar_mire · 2026-09-24