公平性剪枝:定位GLU-MLP层中的人口统计偏见
Pere Martra · hf · 2026-07-31
该研究提出公平性剪枝(Fairness Pruning),一种轻量级结构干预方法,用于管理和缓解大语言模型中的群体偏见。通过最小对比提示对和推理时激活捕获,识别GLU架构中对人口统计属性反应差异的神经元。在高达30亿参数的模型(Llama-3.2系列和Salamandra-2B)上评估,结果表明零化这些神经元会改变模型对相关人口变量的响应,但会导致双向偏见不稳定。干预极其精准:在Llama-3.2-1B中最多零化40个神经元(不到总MLP宽度的0.031%),推理和通用知识能力平均保留99.49%。
「研究」频道最新
- Anima 模型 LoRA 训练翻车:复杂细节难学习 — SulpharTriangle · 2026-07-31
- 论文提出「单例吸引子」模型,量化 AGI 能力阈值 — RecmacfonD · 2026-07-31
- AI 自动处理威胁情报成趋势,但生成质量参差不齐 — cyb3rops · 2026-07-31
- AI「阴谋」行为分类法发布,建立失控事件监测站 — S_OhEigeartaigh · 2026-07-31
- DeepSeek V4长上下文表现受限,全压缩层设计或是短板 — bookwormengr · 2026-07-31
- Jonas Frey 等发布足式机器人新机遇综述 — ChongZzZhang · 2026-07-31