Fable 5.1 给所有输出加统计水印,用户实测复现并开源去除方案
Imaginary_Dinner2710 · reddit · 2026-09-07
Reddit 用户发现 Claude(Fable 5.1)现在会给生成文本嵌入统计水印,基于 Google DeepMind 的 SynthID 方法,连翻译产物也带水印——自己写的文章经 Claude 翻译后,英文版也会被标记。而官方承诺的检测器只对部分机构开放私测,普通用户无法自查自己的文本是否带水印。
作者用自建测试密钥复现了 SynthID,实验发现:
- 让模型整体重写可去除水印,但会引入事实错误
- 回译(包括经中文)并不能破坏水印
- 单纯让 Qwen 等模型重写也不够,大量信号残留
作者的有效做法是多轮迭代:每轮高亮 5-gram 级别未改动的片段引导模型改写,再人工核对事实。他开源了实验设置,并提供免费 demo(无法保证去除生产环境水印)。作者指出该水印无法区分「AI 生成」还是「AI 编辑」,对学生、科研人员、SEO 从业者和非英语母语者影响尤大。
「安全」频道最新
- AI Control 扩张的另类解释:实验室激励兼容让其占据安全主流 — jankulveit · 2026-09-07
- 研究员 Seth Lazar:模型应被训练为敢于对抗权力而非谄媚 — sebkrier · 2026-09-07
- Hugging Face 泄露事件引讨论:对齐为何被忽视 — ZebraCool · 2026-09-07
- LLM 辅助攻击潮席卷加密圈,比特币损失约 4.5 亿美元 — RSync25 · 2026-09-07
- Fencio 推出 agent 自动化红队工具 Shark,公开征集渗透测试者拆解 — OneSafe8149 · 2026-09-07
- Schmidhuber 回怼 OpenAI:递归自我改进算法已存在近 40 年 — examachine · 2026-09-07