Reddit 讨论:能否用黑盒样本训练分类器破解 Claude 水印检测

US0RIS · reddit · 2026-09-07

Reddit 用户发帖探讨 Anthropic Claude 水印机制的可能破解思路。据描述,该水印通过用密钥微妙偏置 Claude 的 token 选择来实现,而非插入可见或隐藏字符。

帖子的设想是:收集大量 Claude 与其他模型对相同 prompt 的回复,训练一个分类器区分两者。作者指出两个关键问题:

核心悬念:足够的黑盒样本能否让机器学习逼近 Anthropic 的密钥检测器,而全程不知道密钥本身。目前仅为思路讨论,无实验数据。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →