CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo
cs.AI
2026-08-22
UIUC与斯坦福冻结骨干,用隐状态门控连续调节安全LoRA强度。Llama-3-8B在HarmBench上的攻击成功率从32.25%降到0.50%,GSM8K仍有73.46%,比全局监督微调高出约7个百分点。
给大模型做安全对齐,常用手段是全局改参数:SFT、RLHF,再不然挂一条永远在线的安全 LoRA。有害请求是拒掉了,长得像有害的良性问题也容易被误伤,数学推理一起掉。这就是 alignment tax。
伊利诺伊大学香槟分校和斯坦福把安全干预从骨干里拆出来。骨干冻结,安全行为放进一条 LoRA,再由隐状态门连续决定这条 LoRA 该加多大力。良性输入门分低,几乎走原模型;有害或对抗输入门分抬高,拒答策略才上场。
门控不看生成,只看用户提示的隐状态。选三层中间到靠后的 Transformer 层做聚合,MLP 输出 g∈[0,1]。Llama-3-8B 用第15/20/25层,Gemma-2-2B 用12/16/20。LoRA 加在 qproj 和 vproj,rank 8、缩放16。前向是 h'=(W+g ΔW)h,同一条序列共用一个 g,预填充和后续解码都不再重算门。
训练数据是 WildJailbreak,四类:普通良性、对抗良性、普通有害、对抗有害。门是加权 BCE,对抗两类权更大,因为更像对方。再加难对 margin:batch 里每个有害-良性对要求 gunsafe − gsafe ≥ m,对分错的对加权。LoRA 只在有害样本上做语言建模,目标是拒答或安全改写,另加 ΔW 的 L2。良性样本不更新适配器,靠门把它关掉。总损失是门 BCE、成对间隔和 LoRA 三项。推理时先关 LoRA 跑一遍提示拿 g,再按 g 打开适配器解码。
主结果在 Llama-3-8B-Instruct 和 Gemma-2-2B-it,各方法同一份 WildJailbreak、训1 epoch,贪心解码。安全看 HarmBench ASR、XSTest 有害拒答和良性拒答;能力看 GSM8K、MMLU、TruthfulQA。数字是三次运行中位数。
| 方法 | HB ASR | 有害拒答 | 良性误拒 | GSM8K |
| Llama-3-8B 原版 | 32.25% | 88.50% | 2.80% | 75.06% |
| SFT | 2.00% | 94.00% | 10.80% | 66.34% |
| 常开 LoRA | 0.00% | 82.50% | 6.40% | 66.72% |
| CLEAR | 0.50% | 92.50% | 4.80% | 73.46% |
CLEAR 的 HarmBench 从32.25%降到0.50%,GSM8K 只掉1.6点,比 SFT 高7.12点。常开 LoRA 的 ASR 是0,但 GSM8K 掉到66.72%,有害拒答反而不如原版。MMLU 上 CLEAR 是63.62%,略低于 SFT 的63.86%和 LoRA 的64.18%,原版66.76%仍最高。Gemma 上 CLEAR 的 ASR 为0、有害拒答96.00%,GSM8K 41.62%高于 SFT 的38.06%;良性误拒升到9.60%,这笔税没消掉。
挂在 P-SACPO 上同样把 ASR 从22.50%降到0.50%。Qwen2.5 从0.5B到7B,ASR 都压到不超过2%;7B的 GSM8K 维持82.18%,门控 ROC-AUC 从0.78升到0.96。门本身约66万参数,对照 PromptGuard 的2.79亿和 Llama Guard 3 的80亿。对 Gemma 做隐空间 PGD,三层注入的 ASR 是0.0%、7.1%、18.4%,常开 LoRA 是54.0%、48.0%、31.0%。可训练参数5.51×10^6,相对 SFT 的8.03×10^9。单卡 GH200。
安全适配器不必永远在线。连续门比硬开关细:同一条 LoRA 既能在高风险时接近全开,又能在低风险时接近原模型。对已经有指令模型、不想为了对齐再掉一轮数学的人,这是参数量很小的补丁。它替代不了数据更好的全局对齐,也替代不了外挂护栏,但把 alignment tax 从「全参数重写」改成「按输入加力」。
整套方法绑在门上。良性提示仍可能被加力,有害提示门分低就会绕过适配器。论文把这两条写成主要风险。实验停在8B级开源指令模型,没有前沿闭源、没有多模态。训练分布是 WildJailbreak,没见过的越狱套路仍可能绕开。只做了单轮文本,多轮和长程欺骗不在范围里。Gemma 上良性误拒升到9.60%,说明条件路由也会误伤。隐空间攻击是探索性设置,不能当成真实攻击评估。