WeaveMark: Robust and Scalable Multi-bit LLM Watermarking via Coded Payload Spreading
Gang-Hyun Park, Ju-Hyeong Lee, Hee-Youl Kwak, Dae-Young Yun
cs.CR, cs.LG
2026-09-02
蔚山大学提出 WeaveMark:每 token 铺开多比特、层间打乱,再用软判决纠错码解码。200 token 上 32 比特整段匹配率 89.8%,对照 BiMark 只有 20.8%,文本质量几乎不掉。
多比特 LLM 水印要把用户 ID 这类 k 比特消息嵌进生成文本,方便事后溯源。三条指标互相咬:提取准、文本不像加水印、消息还得够长。提准就要把 token 分布推得更开,文本质量掉;加长消息,每个比特分到的 token 票更少,整段对上的概率断崖下跌。
现有方法占了这条前沿的不同位置。MPAC 和 Qu 等人用分段加偏置,载荷能做长,文本质量差。BiMark 用多层无偏重加权,期望上不改 token 分布,但每个 token 只投一比特,长消息或短文本时票数又少又不均,200 token 上 32 比特整段匹配率只有 20.8%。
WeaveMark 在 BiMark 的无偏多层框架上做三件事。
消息先经纠错码编成 n 比特码字。每个 token 不绑单一比特,改由前 h 个 token 伪随机选出 κ 个码字位置(默认 κ=10、层数 ℓ=10),把各层尽量均分给这些位置。同一比特会在更多 token 上被看到,票数分布更匀。多层是顺序作用的,前层信号更清楚:LLaMA-3-8B 上第一层提取准确率 72.20%,第十层掉到 56.98%。固定层分配会让某些比特永远吃到差层,所以再按上下文把层下标打乱。
解码不用硬投票。每个码位用 v1−v0 当软可靠度,再对码本做最大相关。12 比特用扩展 Golay [24,12,8],16 比特用 Reed-Muller [32,16,8],24/32 比特拆成两块。32 比特以内可以枚举,再长这条解码就不划算。
另留若干与消息无关的零比特层,分区只由上下文决定,用来做「有没有水印」的 z 检验,避开「在所有分区里取最大」把空文本统计量抬高的问题。
无偏性还在:每层的重加权方向仍是公平硬币,期望上不改原分布。
主实验用 LLaMA-3-8B、C4 RealNewsLike,对照 BiMark、MPAC、Qu et al.。
| 设置 | WeaveMark | BiMark |
| 32 比特 / 200 token 整段匹配 | 89.84% | 20.78% |
| 16 比特 / 50 token 整段匹配 | 76.02% | 4.84% |
| 16 比特、10% 同义替换 | 86.02% | 30.67% |
| 16 比特、20% 同义替换 | 44.20% | 6.59% |
消融很干净:只加多比特嵌入,匹配率 20.78%→24.00%;再加层打乱到 55.88%;软判决 ECC 把比特准确率从 96.67% 降到 90.51%(校验位变多),整段匹配率却升到 89.84%。16 比特、200 token 上匹配率 96.6%,文本质量 BERTScore 30.5,能稳定过 80% 匹配的载荷超过 32 比特;BiMark 三项是 83.0 / 30.3 / 16。
下游任务上,摘要 BERTScore 30.48,无水印 30.54,BiMark 30.27;MPAC(δ=3.0)掉到 26.53。纯零比特设定、FPR=1%、50 token 时 TPR 96.94%,略高于 KGW(96.51%)和 SynthID(94.2%)。多比特设定里划出 2 层做检测后,32 比特匹配率降到 71.17%,仍远高于 BiMark 的 19.4%。
想在生成文本里嵌用户级 ID、又不愿牺牲流畅度的人,可以看这篇。它证明无偏多层水印的载荷瓶颈主要在「一 token 一比特 + 硬投票」,摊开再加软解码就能把 32 比特整段恢复做成可用。检测和溯源可以拆开:零比特层管「是不是水印」,其余层管「是谁」。代码已公开。
代价也清楚。需要在采样时改 logits,不能事后给黑盒 API 打标。纠错码枚举停在 32 比特。这是工程上把通信里的扩频和软判决搬进 LLM 水印,没有给出新的信息论界限。
论文没有单独的局限节。附录自己承认:同义替换到 30% 时,Qu et al.(δ=3.0)在短消息上略强,12 比特、200 token 是 25.90% 对 19.74%。一个原因是无偏设计必须用窗口 2,替换一个 token 会污染后两个位置;偏置方法可以用窗口 1。DIPPER 改写(词汇和语序都开到 20)后,16 比特匹配率只剩 49.02%。生成用了 4-bit 量化的 LLaMA-3-8B,困惑度绝对值不能当真。没有针对自适应去水印或知道密钥的攻击。主结果停在 32 比特、英文新闻续写,中文、代码、对话场景没有报。