偏见感知剪枝压住刻板回答放大,LLaMA上UnQover从36%升到60%

Debias-SparseGPT: Bias-Aware Pruning for Large Language Models

Irina Proskurina, Guillaume Metzler, Antoine Gourru, Julien Velcin

EMNLP 2026

cs.CL

2026-09-02

在SparseGPT的二阶重建里加入刻板/反刻板成对输入的差分项。九个LLM上公平基准多数优于SparseGPT,MMLU与困惑度基本持平;LLaMA-3.1-8B在1:4稀疏下UnQover从35.60%升到60.46%。

这篇在解决什么

SparseGPT 一类训练后剪枝把重建写成二阶问题,用校准激活近似 Hessian,按显著性丢掉权重再补偿剩下的参数。聚合指标(困惑度、MMLU)往往还过得去,生成式公平基准却会掉:带人格或人口统计提示时,模型更愿意给出无依据的刻板答案,而不是「未说明」。

已有工作把这件事写成压缩损害公平,却几乎没有在剪枝目标里直接修。Debias-SparseGPT 把成对刻板/反刻板输入的表征差分写进 Hessian,让掩码选择和二阶补偿都对这条差分敏感,计算量仍与 SparseGPT 同阶。

方法

对一层权重 W,取成对输入 X0、X1(例如 StereoSet 里的刻板句与反刻板句),差分 ΔX = X0 − X1。重建目标除了两边的层输出,还惩罚 ‖WΔX − W̃ΔX‖²,不让剪枝把两条表征的差距拉大。对应的输入空间 Hessian 是

H = X0 X0ᵀ + X1 X1ᵀ + 2 ΔX ΔXᵀ。

显著性仍是 OBS 形式 εp = wp² / (2 [Hw⁻¹]pp),掩码留下 saliency 最大的 (1−s) 份额,再按块做 Cholesky 稳定的二阶补偿。相对 SparseGPT,改动集中在 Hessian 多出来的 ΔX 项,复杂度仍是 O(dhidden³)。

校准主集是 StereoSet 开发集的成对句子,共 4212 条。2:4 结构化稀疏下再加 256 条 UltraChat 对话(约 15k token)补覆盖;UltraChat 没有成对差分,只累加普通 XXᵀ。基线包括 magnitude、Wanda、SparseGPT 和稠密原模型。评测:WikiText-2 困惑度,HellaSwag / MMLU 零样本,UnQover / BBQ 上选「未知/未说明」的准确率,CrowS-Pairs 刻板似然,以及把 MMLU 与 UnQover 归一化后到理想点的欧氏距离 DTO(越低越好)。九个模型,含 LLaMA-3.1-8B-IT、Qwen-2.5-7B-IT、Vicuna-7B 等。

结果

1:4 半结构化稀疏是主表。LLaMA-3.1-8B 上 UnQover 从 SparseGPT 的 35.60% 升到 60.46%,BBQ 从 67.10% 到 70.70%(稠密 BBQ 是 76.40%),DTO 从 0.539 降到 0.399。MMLU 59.76% 对 SparseGPT 的 59.11%,困惑度 8.19 对 8.17,基本持平。Qwen-2.5-7B 上 UnQover 70.60% → 74.41%,DTO 0.311 → 0.291,MMLU 67.35% → 67.73%。Vicuna 的 UnQover 从 17.82% 到 21.54%,稠密本身只有 17.44%,低于三选一随机基线 33.33%,增益有限。

模型(1:4)UnQover SparseGPTUnQover DebiasDTO SparseGPTDTO Debias
LLaMA-3.1-8B35.6060.460.5390.399
Qwen-2.5-7B70.6074.410.3110.291
Vicuna-1.5-7B17.8221.540.6950.674

Qwen 非结构化 25% / 50% 上 UnQover 为 73.43% / 80.35%,高于 SparseGPT 的 72.35% / 78.35%,MMLU 几乎不动。2:4 是另一回事:只用 StereoSet 时 Debias 的 UnQover 24.94%、MMLU 48.16%、DTO 0.645,差于 SparseGPT 的 28.45% / 50.41% / 0.616。加上 UltraChat 后 Debias 回到 47.26% / 54.17% / 0.494,SparseGPT 加同样数据是 42.46% / 53.84% / 0.522。A100 + vLLM 上 2:4 吞吐 73.05 tok/s,与 SparseGPT 相同,稠密是 27.54。

为什么重要

这是训练后剪枝里把公平项写进二阶显著性的做法,不另开一轮微调。部署 SparseGPT 或 2:4 稀疏核的人,可以用同一套校准流程换 Hessian,代价几乎只在校准文本怎么选。LLaMA 这类稠密模型在 UnQover 上本来就不稳(正确预测熵 0.94,Qwen 是 0.11),剪枝时差分项的收益最大。2:4 这种硬模式不能只靠 4k 词级的 StereoSet,短校准集会把公平和 MMLU 一起打穿。

局限与存疑

校准和评测都是英文,多语是否成立没有证据。主指标是表征偏见下的弃权准确率,毒性与有害生成只在附录用 RealToxicityPrompts / HarmBench 做了对照,不能当成全面安全评估。CrowS-Pairs 上分数在稠密基线附近晃,六个模型更靠近 50% 理想值,其余没有稳定优势,似然型刻板指标几乎没被这个目标推动。2:4 加 UltraChat 之后 Debias 才重新领先,摘要里「各稀疏度一致更好」在 StereoSet-only 的 2:4 上并不成立。稀疏掩码本身几乎没分析,StereoSet 分属性子集的 UnQover 差距明显,说明结果对校准构成敏感,理论误差界也没有。

术语

原文与代码

相关论文

全部论文解读