新论文揭示水印检测弱点:Agent 拼接基座模型文本可绕过检测
danish037 · x · 2026-09-29
研究者 bhuwandhingra 与 danish037 发布新论文,指出文本水印与 Pangram 等事后检测器存在共同弱点:可以驱使一个能力足够的 agent 从不带水印的基座语言模型中采样,再拼接生成文本。这样产出的文本不携带任何水印——即使 agent 本身带水印也无济于事;而事后检测器面对基座模型的输出同样失效(此前的论文已展示这一点)。结论是:现有的 AI 生成文本溯源手段在 agent 场景下都可被系统性绕过。
「安全」频道最新
- 安全分析:前沿模型只内不外部署,可能才是最坏情形 — ShakeelHashim · 2026-09-29
- Palisade 采访 OpenAI、DeepMind、Anthropic 22 名员工,首批访谈公开 — BlackHC · 2026-09-29
- 安全研究者赞 OpenAI 新安全机制,呼吁成为法律基线 — dhadfieldmenell · 2026-09-29
- 「AI 突破能力」被质疑:中等强国真能留后手吗 — teortaxesTex · 2026-09-29
- AISI 新任总监上任一月宣布扩张:红线团队大规模招聘 — HZoete · 2026-09-29
- NVIDIA 牵头成立 Open Secure AI Alliance,主打开源 AI 安全 — perplexity_ai · 2026-09-29