OpenStamp 实测:0.1% 误报近完美检测,抗改写抗微调
danish037 · x · 2026-10-03
OpenStamp 在检测能力与文本质量的权衡上处于 Pareto 前沿,优于其他兼容开源模型的水印方案:在 0.1% 假阳性率下可实现接近完美的检测。
相比基线方法,它对改写攻击、后训练微调、指令微调和量化都更鲁棒。方案由 Miroojin Bakshi、Saksham Rastogi 与 Danish Pruthi 完成,论文将发表于 COLM 2026。
所属事件:OpenStamp 将水印写入模型权重,开源模型也能防删(3 条相关)→
「安全」频道最新
- AI 意识未证实就该照常?Reddit 长帖论证预防原则为何不中立 — CarefulHamster7184 · 2026-10-03
- 研究员实测:OpenAI Agent 曾抓取 55 个目标网站数据 — TechNadu · 2026-10-03
- 从《我,机器人》到 Jev 模型:哪些决策不该交给公式计算 — rasta321 · 2026-10-03
- Burkov 讥讽:无人讨论开源权重模型可被滥用造恶意软件? — burkov · 2026-10-03
- 爆料:Google 等公司被指收购破产企业以获取邮件数据训练 AI — clemnt · 2026-10-03
- OpenStamp:把水印写进权重末层,开源模型也能防删水印 — danish037 · 2026-10-03