防 LLM 被蒸馏窃取:文本水印技术或迎实际落地

yuxiangw_cs · x · 2026-08-11

随着大模型通过 API 被蒸馏窃取的风险增加,学术界早先提出的抗蒸馏文本水印技术重新展现出实用价值。

该技术通过在模型预测概率中注入与密钥对应的水印,不仅能保护模型知识产权,还能通过探测嫌疑模型准确识别窃取行为。实验证明该方法在多项 NLP 任务中实现了 100% 的平均检测精度,且不损失模型原有准确率。

作者借此向 Anthropic 发问:未来 Claude 等模型是否会推出不含水印的“高级付费版”以区分调用场景?

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →