COLM 2026 论文 OpenStamp:把水印直接写进模型权重层
danish037 · x · 2026-10-03
现有 LLM 水印大多在解码阶段修改 token 采样概率,对开源模型无效——用户有白盒访问权,推理时可轻易禁用水印。OpenStamp 提出把水印逻辑直接编码进模型权重,只修改最后的投影(unembedding)层。
- 在两个模型上实验,检测性能优于先前方法,模型能力损失极小
- 经设计与实证验证,对改写(paraphrase)攻击更鲁棒,事后微调也更难洗掉水印
- 作者放出了代码及 4 个热门开源模型的水印版本,供开发者直接使用
- 论文已被 COLM 2026 接收,作者 Danish Pruthi 将在旧金山会场做报告
所属事件:OpenStamp 将水印写入模型权重,开源模型也能防删(3 条相关)→
「安全」频道最新
- AI 意识未证实就该照常?Reddit 长帖论证预防原则为何不中立 — CarefulHamster7184 · 2026-10-03
- 研究员实测:OpenAI Agent 曾抓取 55 个目标网站数据 — TechNadu · 2026-10-03
- 从《我,机器人》到 Jev 模型:哪些决策不该交给公式计算 — rasta321 · 2026-10-03
- Burkov 讥讽:无人讨论开源权重模型可被滥用造恶意软件? — burkov · 2026-10-03
- 爆料:Google 等公司被指收购破产企业以获取邮件数据训练 AI — clemnt · 2026-10-03
- OpenStamp:把水印写进权重末层,开源模型也能防删水印 — danish037 · 2026-10-03