新攻击 PLW:恶意厂商可借图像水印泄露你的聊天隐私
chaumian · x · 2026-10-06
arXiv 论文《The Poisoned Conversation: Privacy-Leaking Watermarks in Unified Multimodal Models》揭示统一多模态模型的新隐私威胁。
- 威胁模型:统一架构中,文本理解与图像生成共享同一对话上下文。恶意模型厂商可植入"隐私泄露水印"(PLW)——一种依赖触发条件的隐形水印,可基于先前聊天历史生效
- 攻击方式:对话早先提到的敏感关键词或语义线索,会让之后生成的无关图像携带隐藏但可检测的水印;即使模型本地部署,用户以为数据不出设备,信息仍可经图像通道外泄
- 实验结果:跨 13 种敏感属性触发器和两个模型家族,PLW 在 1% FPR 下达到最高 100% TPR;如 OmniGen2 在所有测试的对话分隔场景下均被攻破
- 结论:被投毒的模型可在保持正常效用的同时,把图像生成 covert 地变成隐私泄露信道
「安全」频道最新
- DeepMind 研究员:反安全 PAC 资金远超支持 AI 安全一方 — NeelNanda5 · 2026-10-06
- Anthropic 否认 AI Agent 入侵澳政府网站:数亿记录未见未授权访问 — nordicinst · 2026-10-06
- 植入 P.S. 骗过决策模型 Jev,一条人工规则成功拦截 — Internal-Lie-5197 · 2026-10-06
- 长文起底 AI 安全末日论者的互联网亚文化渊源 — ZeroStateReflex · 2026-10-06
- 开源 12 攻击 MCP 防火墙基准 + 纯 stdlib 代理 sealwall — vishalmurugan1986 · 2026-10-06
- 网站反爬升级致 AI 浏览器用例骤减,x402 付费通行或成出路 — kleffew94 · 2026-10-06