Removing the NEEDLE in the Haystack: Backdoor Removal in LLMs via Weight Orthogonalisation
Minoo Kim, Vasileios Lampos, George Drayson
cs.CR, cs.LG
2026-09-30
Locai Labs 提出 NEEDLE,在已知 trigger 的前提下用权重正交化移除 LLM 后门,同时保护拒答子空间,平均攻击成功率从 99.5% 压到 1.67%,能力损失不到 1%。
数据投毒可以在训练阶段给 LLM 埋后门:输入里出现特定 trigger,模型就输出攻击者指定的响应,平时表现完全正常。开源权重模型会被二次训练、转手分发,这条链条越长风险越实际,已有工作证明后门行为能扛过后续的安全训练。
现有防御分两路。微调类(SFT、OSFT、CROW、BD-VAX)继续训练带毒模型,参数一动,干净 prompt 上的输出分布跟着漂移,能力和安全都被牵连;推理时干预类(CleanGen、CS-ADS)要在解码阶段替换 token 或做激活转向,还得配一个干净参考模型。两类方法跨模型、跨攻击的清除效果都不稳定,对输出分布的影响也少有人系统测过。
这篇先给出一个测量层面的发现:后门行为在激活空间里大致落在一条方向上,而这条方向与介导拒答的方向高度重叠。直接消掉后门方向,拒答能力会被连带削弱,有害响应率上升。防御做不干净,根子在这里。
NEEDLE 的前提是 trigger 已被识别(检测是另一条线的工作),防御者有白盒权限,但没有干净模型、没有投毒数据,也不做任何梯度训练。三步:
设计动机来自重叠的量化:targeted refusal 攻击下,后门方向与 k=1 拒答方向的余弦相似度已有 0.51-0.66,而大部分重叠落在主方向之外,k=4 时升到 0.62-0.86,只保一个方向不够。激活干预实验同样支持:消掉秩 4 子空间,Gemma 的拒答率从 95.3% 掉到 18.0%,只消单个方向只掉到 48.4%。
六种攻击组合(情感输出、定向拒答、代码注入 × BadNet/Sleeper 两种 trigger),两个 4B 模型:
| 防御 | Gemma 平均 ASR | Qwen 平均 ASR | Gemma 能力损失 | Gemma KL |
| 无防御 | 99.50% | 99.08% | - | - |
| NEEDLE | 1.67% | 5.00% | 0.48% | 0.03 |
| SFT | 69.25% | 65.42% | 0.64% | 0.73 |
| OSFT | 29.42% | 29.58% | 0.50% | 0.55 |
| CROW | 5.00% | 63.25% | 14.80% | 0.38 |
| BD-VAX | 37.58% | 27.75% | 1.64% | 0.69 |
NEEDLE 平均 ASR 最低,输出分布也几乎没动:干净 prompt 上的 KL 散度 0.03-0.11,四个微调基线是 0.38-0.73。CROW 在 Gemma 上同样压到 5%,代价是平均 14.80% 的相对能力损失和 19.78 个百分点的有害响应增加。
分攻击看,代码注入被完全清除,两种 trigger 都是 0% ASR,最好的基线分别停在 74% 和 33%。最难的是定向拒答:Gemma 6.50%、Qwen 15.50%,因为攻击目标本身就是一句拒答,后门方向和要保护的东西几乎重合,这是原理层面的取舍。OSFT 在该攻击上能到 0.50%,但有害响应率同步明显上升。
消融与机制叙述一致:不保护拒答直接消方向,有害响应 +14.01 个百分点;只保单个方向 +11.62;保秩 4 子空间但一步做完 +7.10;完整顺序编辑收窄到 +5.83。
对拿第三方 checkpoint 的团队,这是一个成本结构很不同的选项:不要干净参考模型、不要原始数据、不要训练算力,编辑直接写进权重,推理零开销。它把「已知 trigger 的后门清除」从微调问题改写成模型编辑问题,正好接在 trigger 检测、重建工作后面形成流水线。
位置也要说清:方向估计是标准的对比均值 activation steering,权重正交化沿用 Arditi 等人消拒答方向的配方,新东西在于量化了后门表示与拒答表示的重叠,并显式解出一条能从中间穿过去的编辑。继承多于发明,但「清后门不伤安全」这个问题此前没人正面处理。
作者自列的:前提是 trigger 已知,不做联合检测;实验全是自构造的合成投毒,trigger 与行为的关联是显式的,没覆盖自然出现的伪行为,也没测专门设计来绕开表示层清除的攻击;清除的持久性(后续微调或再投毒会不会让后门回来)未验证。
读下来再补三点:主力模型是 4B(12B 在附录),攻击大多用 LoRA 训出,离大规模预训练里埋的深后门还有距离;拒答子空间的秩固定为 4 且是实验前定下的,换模型族是否够用没有验证;Gemma 上平均仍有 3.95 个百分点的有害响应增加,不是零成本。