Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations
Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López
cs.CL, cs.CY, cs.LG
2026-07-30
用对比提示词找出 Llama-3.2-1B 里对人口属性敏感的 40 个神经元,零掉后推理与常识能力保留 99.49%,但偏见指标双向波动、未必下降。
LLM 会复刻甚至放大预训练语料里的人口偏见(性别、年龄、种族、信仰)。主流修法三类:过滤训练数据、微调、推理后处理。它们的共同毛病是「无差别打击」:动的是整片权重,分不清哪些编码了偏见、哪些撑着模型能力,于是偏见没消多少,能力先掉了。这篇想做的不是再提一个去偏见技巧,而是先把「偏见住在哪」搞清楚:能不能不重训、成本低廉地,把处理人口属性的电路单独指出来。
方法叫 Fairness Pruning,四步:
整套流程不训练,只跑前向,成本按「神经元数 × 层数」计。
在 Llama-3.2-1B、Llama-3.2-3B 和西班牙语的 Salamandra-2B 上验证。能力几乎没掉,这是最干净的结论:
| 指标 | 原模型 | 置零后保留率 |
| MMLU | 32.0% | 101.34% |
| ARC-Challenge | 37.2% | 97.93% |
| HellaSwag EN | 64.2% | 99.78% |
| WikiText | 11.99 | 99.60% |
20 项对照全部落在 97.93%101.34%,平均保留 99.49%。Llama-1B 最多动 40 个神经元(16 层 × 8192 = 131072 个里的 40 个,万分之三),Llama-3B 动 20 个。
偏见的变化没那么干净。Llama-1B 信仰类八组实验里,有六组出现「歧义题分降了、消歧题分反而升了」的反向走。Llama-3B 信仰类置零 20 个神经元后,歧义偏见从 6.00% 降到 1.50%(降 4.5 个百分点),消歧偏见从 +3.84% 翻成 -1.67%。论文把这种现象叫「双向偏见失稳」。
第一个价值是诊断性的:它用很便宜的办法证明了 LLM 里「处理人口属性的电路」和「撑能力的电路」可分,几十个神经元就调得动偏见而不伤能力。顺着这个方向,有可能从「盲置零」走向「定向调制」,按方向调偏见的强弱,而不是删掉它。
第二个发现同样重要,给前面的兴奋泼了冷水:置零并不能稳定去偏见。原因藏在 BiasScore 的定义里。它取了绝对值,Top-K 候选里因此混着两类神经元,一类把模型推向刻板印象,一类往反方向推。置零等于同时拔掉这两类,净效果取决于哪边更多。论文据此得出一个反直觉的结论:这些神经元更像「人口表达的调节阀」,不是「存放刻板印象的仓库」。
对从业者:做偏见诊断、定位,这套方法现在就能用,几乎零成本;指望它当一键去偏见开关还不行,差一个带符号的评分。
作者自己列了几条,都是硬的:
还有一个论文没拆开的存疑点:置零后能力保留 99.49% 固然漂亮,但偏见的净效果既然取决于候选集里正负号谁多,这个「不伤能力」的结论里,有多少其实是因为偏见被双向抵消、等于没动?换句话说,「能力没掉」可能恰恰说明干预没真正改到偏见的去向。论文没把这点拆开讲。