OpenStamp 实测:0.1% 误报近完美检测,抗改写抗微调

danish037 · x · 2026-10-03

OpenStamp 在检测能力与文本质量的权衡上处于 Pareto 前沿,优于其他兼容开源模型的水印方案:在 0.1% 假阳性率下可实现接近完美的检测。

相比基线方法,它对改写攻击、后训练微调、指令微调和量化都更鲁棒。方案由 Miroojin Bakshi、Saksham Rastogi 与 Danish Pruthi 完成,论文将发表于 COLM 2026。

所属事件:OpenStamp 将水印写入模型权重,开源模型也能防删(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →