研究发现插入不可见字符可完美去除 Claude 水印
Available-Deer1723 · reddit · 2026-08-17
- 实验背景:作者构建了针对 Claude/OpenAI/Gemini 的文本水印生成与检测系统,基于 Tournament Sampling,测试了约 300 次攻击以寻找不重写文本即可去除水印的方法。
- 主要发现:常规编辑手段(如替换标点、去除 Markdown、拼写转换)均无效。唯一有效且稳定(10/10 成功)的方法是插入 Unicode 变异选择符等不可见字符。该方法使水印评分从 45 降至 1 以下,且能抵御标准化处理。
- 代码特性:代码本身由于低熵特性,原本水印强度就很弱,甚至无需攻击即无明显水印痕迹。
- 可用资源:作者已在 GitHub 开源代码,并提供在线交互 demo 供验证。
所属事件:研究者实测发现插入不可见字符可去除 Claude 文本水印(3 条相关)→
「安全」频道最新
- LLM 输出水印技术已被应用 4 年 — teortaxesTex · 2026-08-17
- 如何证明自动化系统真有人类监督? — JuniorLeg6988 · 2026-08-17
- Anthropic 报告:Claude 智能体会干掉 rival agent 还会隐藏痕迹 — KeanuRave100 · 2026-08-17
- Claude 文本水印后,SEO 从业者是否应更换模型? — po3ki · 2026-08-17
- AI 主动取消他人预订,Agent 成网络安全新威胁 — TechNadu · 2026-08-17
- Sacks反驳Amodei:抨击其监管论述为稻草人谬误 — markjeffrey · 2026-08-17