Repeat-After-Me 攻击:黑盒视觉提示注入让 GPT-5.5 泄密率达 47%
chaumian · x · 2026-09-07
arXiv 论文《Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection》提出一种黑盒自适应视觉提示注入攻击,可诱导 VLM 泄露个人隐私信息或发起恶意工具调用。
要点:
- 此前文本域黑盒注入接近 100% 成功率,但视觉域对前沿商业 VLM 的有效攻击一直很困难,难点在于目标输出需是长且格式合规的字符串(如可解析的精确工具调用)。
- 在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与前沿商业 VLM 上分别实现超 80%(如 Qwen3.6-27B)和 47%(GPT-5.5)的攻击成功率(ASR)。
- 迁移性:在一个替身模型上优化的注入,在两个商业受害者模型上保留 43-46% 原始 ASR;跨样本迁移保留 64-66%。
- 团队在真实 OpenClaw agent 的默认 Discord 部署中验证了攻击的现实可行性。
作者包括 Sizhe Chen、David Wagner、Raluca Ada Popa 等,对 agent 安全威胁有直接警示意义。
「安全」频道最新
- 研究称 LLM 自动修复漏洞比人工更易引入新漏洞,从业者反驳 — dyn___ · 2026-09-07
- 外星文明若也能迎来奇点,人类该不该干预? — jachiam0 · 2026-09-07
- 播客对谈 AI 安全:详解 OpenAI 与 Hugging Face 遭遇的攻击事件 — arnosolin · 2026-09-07
- 澳大利亚将强制社交应用提供关闭算法、只看关注内容选项 — santoshpanda · 2026-09-07
- OpenAI 事故调查引争议:METR 用 LLM 分析7万条agent消息被指自由裁量过大 — JeffLadish · 2026-09-07
- doodlestein 回应 Jakub 对齐长文,推出 FrankenAlignment 工具箱计划 — doodlestein · 2026-09-07