Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

Pere Martra · hf · 2026-07-31

This work presents Fairness Pruning, a lightweight structural intervention method for managing and mitigating demographic bias in LLMs. Using minimally contrastive prompt pairs and inference-time activation capture, it identifies neurons that react differentially to demographic attributes in GLU architectures. Evaluated on models up to 3B parameters (Llama-3.2 family and Salamandra-2B), results show zeroing these neurons alters responses to demographic variables but causes bidirectional bias destabilization. The intervention is surgical: zeroing at most 40 neurons in Llama-3.2-1B (<0.031% of MLP width) retains 99.49% of reasoning and general knowledge.

Original post →

More from Research

Research channel →