Claude 全线嵌入不可见水印,从可证安全隐看到可证无损
新智元 · wechat · 2026-08-17
2026 年 8 月 11 日 Anthropic 宣布:自 8 月 2 日起发布的新版 Claude 模型,将在生成文本中嵌入人眼不可见、机器可读的隐形水印,内容被复制传播后仍可被软件识别溯源。水印不改变语义、质量与可读性,覆盖网页端、API 与 Claude Code,全球生效且不可关闭;图像等文件附带 C2PA 标准数字签名元数据。这是 Anthropic 签署欧盟《AI 法案》第 50 条透明度行为准则后的标志性举措。
文章进而梳理了「可证安全隐写」的理论脉络:从 Shannon(1949)、Cachin(1998)到 Blum 等人的计算安全框架(2002),长期受限于载体分布需可精确采样;2018 年中科大团队率先提出生成式可证安全隐写(黑盒采样与压缩—可逆采样两套框架),此后清华、波士顿大学、牛津等跟进,路线从对称密钥走向公钥(ECC 结合生成模型)、无盒提取(Disreo)、灰盒场景(基于推测采样的 SpecStega,载荷率较黑盒方案提升 20 倍以上),并用 SyncPool 消除 token 子词歧义。
最后落到水印落地:可证安全隐写保证嵌入不改变采样分布,即「可证生成质量无损水印」。中科大团队的相关系统已应用于星火大模型等平台、服务 1.3 万名开发者;图像侧有 GaussianShading(CVPR 2024)等即插即用可证无损方案,并延伸到「可证性能无损」的黑盒模型水印。作者指出水印攻防本质是质量约束下的代价博弈,「无损」正是双方共同的约束与追求。
所属事件:Anthropic 为 Claude 嵌入不可见水印,合规与监控争议齐发(20 条相关)→
「安全」频道最新
- OpenAI新模型Astra因触达Critical能力阈值暂停部分开发 — johnseach · 2026-08-17
- LLM 水印会降低文本质量吗?Anthropic 示例引发争议 — JeremyNguyenPhD · 2026-08-17
- 摩根大通 CEO 谈 AI:最大风险是网络安全,将缩短工作周 — Roger_M_Taylor · 2026-08-17
- 水印与限额之下,托管模型实用性还能维持多久? — vboykis · 2026-08-17
- Zvi评OpenAI/HF攻击:HF未主动要求使用闭源模型,训练中问题早已存在 — TheZvi · 2026-08-17
- 开发者打造 MCP SSH 服务器:代理可操作服务器但永不持有密钥 — NoStrawberry1162 · 2026-08-17