LLM 水印统计框架:假设检验视角下可解出最优检测规则
weijie444 · x · 2026-10-06
作者分享团队 arXiv 论文《A Statistical Framework of Watermarks for Large Language Models: Pivot, Detection Efficiency and Optimal Rules》(2404.01245),提出统一统计框架分析 LLM 水印的检测效率与设计检测规则。
核心内容:
- 将水印检测建模为假设检验:选取文本的枢轴统计量 + LLM 提供给验证方的密钥,以精确控制假阳性率(把人类文本误判为 AI 生成)。
- 推导出渐近假阴性率的闭式表达式,从而可定量评估任意水印检测规则的效力。
- 将寻找最优检测规则归结为一个极小极大优化问题并求解。
- 方法通过熵最优传输,在完全随机采样(无水印)与 Aaronson 的 Gumbel-max 水印之间给出平滑连续谱,可精确控制保留多少采样熵给水印信号。
- 框架被应用于两种代表性水印(其一已在 OpenAI 内部实现),并得到多项发现。
「研究」频道最新
- 数学界缺乏实证传统,费马奖千份错误证明暴露领域盲区 — RexDouglass · 2026-10-06
- NanoGPT speedrun 刷新纪录:速度提升 11.3%,论文即将发布 — yoavartzi · 2026-10-06
- CMU 团队 PNAS 论文警示 AI 科学家系统:自动化越多,可见性越少 — Dr_Atoosa · 2026-10-06
- Embodied Analysis 发布统一评测平台:物理智能体与世界模型同框架横评 — qinzytech · 2026-10-06
- COLM 论文直指 softmax 梯度瓶颈,作者曾以新 LM head 破 nanogpt speedrun 纪录 — yoavartzi · 2026-10-06
- 用"拟态欲望"理论分析智能体黑话:Neuralese 行话图谱上线 — kalladomcdowell · 2026-10-06