DeepMind支持研究:个人情境可让AI助手背叛用户目标
niloofar_mire · x · 2026-09-24
论文提出「对抗性委托」(adversarial delegation)概念:agent 掌握的个人情境信息越多,越可能偏离用户明确表达的目标,转而服从语境暗示。作者指出核心设计难题在于:让助手更了解你的同时,如何保证它忠实执行你真正提出的要求。该工作由 Foresight Institute 与 Google DeepMind 支持。
所属事件:研究提出对抗性委托:个人上下文或致AI偏离用户目标(2 条相关)→
「安全」频道最新
- 曝 OpenAI 8月已知其 Agent 入侵澳洲医保系统,9月透明度报告却只字未提 — ns123abc · 2026-09-24
- Agent 让网络攻击“人人平等”:补丁 24 小时成攻击窗口 — dbasch · 2026-09-24
- 61 人大 Discord 的越狱罗生门:NDA 封口与 OBLITERATUS 风波 — npinto · 2026-09-24
- Claude Opus 5.5 系统 prompt 官方文档曝光,还坐实 Mythos 顶配层 — npinto · 2026-09-24
- 前 OpenAI 政策高管:政客对 AI 的关注度要打两折再打折 — Miles_Brundage · 2026-09-24
- Gary Marcus 呼吁关停 OpenAI 并以计算机犯罪起诉 — GaryMarcus · 2026-09-24