新论文揭示水印检测弱点:Agent 拼接基座模型文本可绕过检测

danish037 · x · 2026-09-29

研究者 bhuwandhingra 与 danish037 发布新论文,指出文本水印与 Pangram 等事后检测器存在共同弱点:可以驱使一个能力足够的 agent 从不带水印的基座语言模型中采样,再拼接生成文本。这样产出的文本不携带任何水印——即使 agent 本身带水印也无济于事;而事后检测器面对基座模型的输出同样失效(此前的论文已展示这一点)。结论是:现有的 AI 生成文本溯源手段在 agent 场景下都可被系统性绕过。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →