研究员解析 LLM 水印:仅占用极小熵值,低熵输出难标记

RyanGreenblatt · x · 2026-08-12

AI 安全研究员 Ryan Greenblatt 针对大模型文本水印技术进行了深度解析。他指出,水印技术通常只占用模型可用熵(entropy)的极小部分。其机制类似于将采样温度从允许的最高值(如 t=1)微调至 t=0.9,但并不会额外提升高概率 token 的出现频率。

这种机制带来一个直接限制:低熵输出几乎无法被有效打上水印。例如,当输出文本极短或内容几乎完全确定(如简单的文本编辑或微调)时,水印机制便会失效。

所属事件:研究员解析大模型水印机制:低熵输出难标记(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →