研究:为性别包容微调 GPT 反而制造了新的单向偏见

maier_ak · x · 2026-09-03

米兰比可卡大学学者 Fulgu 与 Capraro 的 2024 年研究发现,对 GPT-3.5、GPT-4、GPT-4o 做性别包容性微调后,模型反而出现了方向不对称的新偏见。

作者 Andreas Maier 在 Substack 长文中指出,新意不在于确认 GPT 有性别偏见(已有大量记录),而在于证明这种偏见的方向性不对称是在微调对齐之后才出现的——包容性训练本身可能制造新的不平等。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →