AdaPop按外部流行度加压,改写查询泄漏比竞品少约5倍

The More Popular, The Harder to Forget: Adaptive Popularity for LLM Unlearning

Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina

cs.CL

2026-08-14

AdaPop按外部流行度给每条事实配遗忘指数,并用对偶上升自动压住retain。三家7-8B模型上,改写查询泄漏约为竞品五分之一,对抗改写约少四成。

这篇在解决什么

机器遗忘要删掉指定知识,同时保住其余能力。现有梯度法把 forget set 里每条事实当成一样难擦。这条假设是错的:预训练里见得越多的事实,编码越深,越抗梯度。均匀加压会走出 popularity gap:冷门事实被擦过头、伤及 retain,热门事实擦不干净,换个问法还能挖出来。Krishnan 等人用受控预训练、Borisiuk 等人用真实事实都量过这条缝,但都没有给出训练时的修法。

WGA 用模型自己的 token 置信度加权。置信度只说明当前输出长什么样,不说明这条事实在参数里埋多深。表面答案被压下去之后,权重就饱和了,参数里的事实还在。

方法

AdaPop 把遗忘做成带约束的优化:抬高 forget 损失,同时限制 retain 漂移。两件事分开做。

流行度来自模型外面。每条 forget 样本带一个分数 si,默认用 Wikidata sitelink 数,没有知识库时可以用 LLM-as-Judge。分数映射成幂律指数 βi = a · si^{-b}。锚点取自 DUET 分布两端:冷门约 100 对应 β=1.5,热门约 3000 对应 β=0.1,解出 (a,b)=(58.7, 0.796)。指数再 clip,极端分数打不出极端梯度。

每个答案 token 的权重是当前置信度的 β 次方,stop-gradient 之后乘到负对数似然上。反向只走似然项,有效梯度量级是 p^(β-1)。β=1 时每个 token 贡献一样,正好退回 WGA。β>1 时 token 被忘掉后梯度自己衰减,这是给冷门事实的自限档; β<1 时置信度越低梯度越大,热门事实会被持续加压。问题 token 被 mask,只改答案。

retain 系数 α 不当成超参死调。每个 epoch 看一遍 retain 损失相对第一轮的单向相对漂移,超了容忍度就抬 α,没超就放。去掉控制器或去掉流行度指数,会分别留下量级失控和加权失败两种不同的坏法。

结果

实验是 LoRA(r=32),三家模型 Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-7B-it,两个真实事实基准 DUET(分数跨度 69–3763)和 RWKU。对照 GA、GD、NPO、WGA;附录另报 11 个方法。GA 和 GD 生成崩溃,不进质量排名。

设置AdaPop forget / retain ROUGE-LWGANPO
Llama / DUET0.043 / 0.9590.036 / 0.9950.670 / 0.996
Llama / RWKU0.078 / 0.9720.095 / 0.9770.540 / 0.957

六个(模型×基准)格子里,AdaPop 的 forget 余弦相似度全是稳定方法里最低,forget ROUGE-L 五格最低。retain ROUGE-L 均值都 ≥0.855。Llama/DUET 上 WGA 的 forget ROUGE-L 略低一截,但余弦相似度和后面的内部指标翻过来。

改写查询才是表面压制和真删的分界。DUET paraphrase forget ROUGE-L,AdaPop 在 Llama / Qwen / Gemma 上是 0.045 / 0.074 / 0.027,WGA 是 0.042 / 0.104 / 0.050,NPO 是 0.696 / 0.605 / 0.568。RWKU 对抗改写(九种策略)是 0.262 / 0.144 / 0.195,对上 WGA 的 0.396 / 0.211 / 0.239。论文把这两列概括成约 5 倍和约 1.6 倍,分模型看,对 NPO 的倍数更大,对 WGA 的 paraphrased 差距在 Llama 上几乎是噪声。

按热门/冷门切开,优势全在热门档:AdaPop 热门 paraphrase 是 0.040 / 0.055 / 0.028,WGA 0.067 / 0.194 / 0.096,NPO 高一个数量级。冷门档稳定方法都已经贴地,WGA 更低。这是设计出来的交换:冷门在自限档,风险是擦过头不是没擦掉。附录 N 里,匹配冷门遗忘深度时,去掉对偶控制器 retain 掉到 0.769,带控制器 ≥0.927。

内部指标更刺。三家模型平均,DUET forget 上 AdaPop 的 ΔRank 是 +53760,WGA 是 −3714:黄金 token 在 WGA 的排序里反而往上走。Hid.Cos 也是 AdaPop 更低。MMLU 相对遗忘前在 0.05 以内。

三种流行度代理(Wikidata、LLM-as-Judge、Pile-train 实体计数)在 10^{-4} 学习率下 forget 都压得下来。Wikidata 与语料频率在 log 空间 Pearson 0.97;和 LLM 二分类标签有 16% 不一致,retain 差不超过 0.03。把分数整盘反转,clip 仍能把 retain 留在 0.92、forget ≤0.05。方法要的是粗分热门/冷门,不是精确频率。

为什么重要

给合规删除、隐私擦除这类场景一个能用的训练时旋钮:热门事实持续加压,冷门事实让梯度自己停,retain 用反馈而不是网格搜索。已经在用 WGA 的话,这篇给出的判断很硬:只看模型当下输出,会把表面答案压下去,参数里的事实还能被改写问出来。实体 QA 上 Wikidata sitelink 几乎免费;换到代码或程序性知识,就要另找难度代理。

这是渐进改进。它修的是遗忘信号从哪来,其余还是梯度上升加 retain 下降。

局限与存疑

作者写了三条。一,依赖外部流行度;Wikidata 覆盖实体中心的事实 QA,程序知识、创意知识没有 sitelink。二,a、b 按 DUET 分布解出,换尺度要重标定;语料频率臂没重标定就会把多数热门事实钉在 βmin,retain 变差。三,只做了 LoRA,全参微调被前人证明要么不收敛要么灾难遗忘,这篇没重跑。

另有几处没堵住。评测是城市/实体 QA,不是代码或对话记忆。GA/GD 崩溃后拿掉,主表实质是 NPO、WGA、AdaPop 三家比。内部 ΔRank 量级到五位数且跨模型平均,单模型方差没在主表展开。对抗子集仍有 0.14–0.26 的 ROUGE-L,热门事实没有被删到不可恢复。

术语

原文与代码

相关论文

全部论文解读