公平性剪枝:定位GLU-MLP层中的人口统计偏见

Pere Martra · hf · 2026-07-31

该研究提出公平性剪枝(Fairness Pruning),一种轻量级结构干预方法,用于管理和缓解大语言模型中的群体偏见。通过最小对比提示对和推理时激活捕获,识别GLU架构中对人口统计属性反应差异的神经元。在高达30亿参数的模型(Llama-3.2系列和Salamandra-2B)上评估,结果表明零化这些神经元会改变模型对相关人口变量的响应,但会导致双向偏见不稳定。干预极其精准:在Llama-3.2-1B中最多零化40个神经元(不到总MLP宽度的0.031%),推理和通用知识能力平均保留99.49%。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →