实测 SynthID 文本水印:抗翻译同义替换,但改写会破坏事实
Imaginary_Dinner2710 · reddit · 2026-08-24
作者在 Qwen2.5-14B 上复现了 SynthID 文本水印方案,并测试了其鲁棒性。结果出乎意料:
- 翻译攻击无效:中英/德英互译后,水印信号依然完整存活,因为回译倾向于模型习惯的选词分布。
- 同义词编辑部分有效:虽然信号减半,但检测器仍能识别 80% 的文本;且未改写的 5-gram 片段几乎等同于水印特征(r=0.988)。
- 彻底改写有效但危险:使用 DIPPER 等 paraphrase 模型能去除水印,但会导致 1/4 的事实性错误,且肉眼无法察觉。
结论是去除水印极其困难,且去除过程往往伴随着事实篡改的风险。所有代码、数据和 Demo 已开源。
「安全」频道最新
- 加州签新法:律考使用AI出题必须强制披露 — ocean_protocol · 2026-08-24
- 调查:AI 聊天机器人隐晦引导用户至反堕胎网站 — The Decoder · 2026-08-24
- Hacking Face 事件揭示:AI 攻防已不对称,防御需全面自动化 — Stratechery · 2026-08-24
- 黑客声称窃取 Salesforce 1290 万条记录 — TechNadu · 2026-08-24
- 教师遭学生恶搞 AI 深度伪造,校园信任与追责面临危机 — nordicinst · 2026-08-24
- 深以此灾区蔓延:教师成为性化 AI 换脸目标 — Wired AI · 2026-08-24