AI 文本水印反成软肋:研究称其放大对抗提示风险

luisdans · x · 2026-09-18

Ars Technica 报道的研究指出,给模型输出添加文本水印(watermarking)可能带来安全副作用:水印机制会使模型更容易受到对抗性提示(adversarial prompts)的攻击。

这一发现对当前流行的 AI 内容溯源/水印方案是一个警示——在水印检测与模型鲁棒性之间存在此前较少被讨论的张力,对安全研究和水印部署实践都有参考意义。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →