OpenStamp 将水印写入模型权重,开源模型也能防删
将在 COLM 2026 上报告的 OpenStamp 提出面向开源大语言模型的水印新方案。现有 LLM 水印多在解码阶段修改 token 采样概率,对拥有白盒访问权的开源模型用户无效,水印可被轻易禁用。OpenStamp 将水印逻辑直接编码进模型权重层,实测在 0.1% 假阳性率下可实现接近完美的检测,且在检测能力与文本质量的权衡上处于 Pareto 前沿,优于其他兼容开源模型的方案,同时能有效抵抗改写攻击与微调。
2026-10-03 ~ 2026-10-03 · 3 条相关
- OpenStamp:把水印写进权重末层,开源模型也能防删水印 — danish037 · 2026-10-03
- OpenStamp 实测:0.1% 误报近完美检测,抗改写抗微调 — danish037 · 2026-10-03
另有 1 条近重复转述:danish037