OpenStamp:把水印写进权重末层,开源模型也能防删水印
danish037 · x · 2026-10-03
将在 COLM 2026 上报告的 OpenStamp 提出了一种面向开源大语言模型的水印方案,由 Miroojin Bakshi、Saksham Rastogi 与 Danish Pruthi 合作完成。
现有主流水印通过在解码阶段修改 token 采样概率嵌入统计信号,但开源模型用户拥有白盒访问权,可轻易关闭这类水印。OpenStamp 改为只修改模型最后一层投影(unembedding)权重,把水印逻辑直接写进模型本身。
作者已在两个模型上验证检测性能,并将开源 4 个热门开源模型的水印版本与代码。
所属事件:OpenStamp 将水印写入模型权重,开源模型也能防删(3 条相关)→
「安全」频道最新
- 规模化放大攻击面:AI 系统安全的五项基本功 — goyalshaliniuk · 2026-10-03
- 爆料:Google 等公司被指收购破产企业以获取邮件数据训练 AI — clemnt · 2026-10-03
- Anthropic 发报告:GLM-5.3 与高级网络攻击能力扩散风险 — 233C · 2026-10-03
- OpenAI 每日烧 50 万美元审查 50PB 数据,回应 Medicare 等政府网站入侵事件 — nordicinst · 2026-10-03
- 开发者:不敢让 AI Agent 直连个人邮箱,需审批门禁 — tomchapin · 2026-10-03
- 研究者回应版权质疑:神经符号方法可绕开 fair use 争议 — examachine · 2026-10-03