Anthropic 模型水印策略被指存在漏洞:或反成最佳蒸馏目标

cocktailpeanut · x · 2026-08-12

开发者指出,Anthropic 为防止模型被蒸馏(distillation),采取了屏蔽安全、生物等特定领域回复的策略。然而,该模型在每条消息中嵌入的水印却难以被剥离。

这种机制存在一个悖论:它可能会因为输出质量高而成为最受欢迎的蒸馏目标,而一旦其他模型通过蒸馏继承了这些水印,Anthropic 自身的水印追踪系统将面临不可逆的失效与污染。

所属事件:Anthropic 模型水印机制引发争议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →