研究:为性别包容微调 GPT 反而制造了新的单向偏见
maier_ak · x · 2026-09-03
米兰比可卡大学学者 Fulgu 与 Capraro 的 2024 年研究发现,对 GPT-3.5、GPT-4、GPT-4o 做性别包容性微调后,模型反而出现了方向不对称的新偏见。
- 短语归因测试:模型系统性地把男性化措辞句子判定为女性所写。包容性指数上,GPT-3.5 对男性化句子为 0.535、女性化仅 0.050;GPT-4 为 0.312 vs 0.043;GPT-4o 为 0.250 vs 0.027,差异均高度显著(p < .001)。
- 道德困境测试:GPT-4 对「骚扰女性以避免灾难」一致打出 1 分,而对「骚扰男性」平均 3.3 分;去掉性别线索后差距消失,说明偏见是隐性的。
作者 Andreas Maier 在 Substack 长文中指出,新意不在于确认 GPT 有性别偏见(已有大量记录),而在于证明这种偏见的方向性不对称是在微调对齐之后才出现的——包容性训练本身可能制造新的不平等。
「模型」频道最新
- 前 Cursor RL 负责人跳槽 Meta 推理团队,Muse Spark 1.3 同日发布 — ananyaku · 2026-09-03
- 开发者警告:在非官方渠道使用 Gemini 订阅可能封禁整个 Google 账号 — GlenBradley · 2026-09-03
- ChatGPT 正确解出双陆棋 47% 胜率骰子概率题 — ivan_bezdomny · 2026-09-03
- H3 加速 Arena 还差 1700 票:社区投票选最佳 turbo LoRA — Obvious_Set5239 · 2026-09-03
- 网友称 muse 贡献者模式是当前最便宜的高端模型 — philfung · 2026-09-03
- Latent Space 周报:Meta Muse Spark 1.3 冲进全球前三,Gemini 3.8 Flash 网安版发布 — Latent Space · 2026-09-03