Repeat-After-Me 攻击:一张图即可劫持 Agent 工具调用

arXiv 论文《Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection》提出一种黑盒自适应视觉提示注入攻击:恶意图像可诱导前沿视觉模型生成格式正确且真实执行的 tool call,其中 GPT-5.5 的泄密率达 47%。研究人员演示了该攻击对智能体工具调用的劫持能力,凸显多模态 Agent 面临的新型安全风险。

2026-09-07 ~ 2026-09-08 · 2 条相关