研究测 13 款主流 LLM:10%-35% 陈述因说话者性别被改判真假
anthara_ai · x · 2026-09-03
一项针对 13 款主流大模型的实验发现,所有模型都表现出对男性的显著负面情绪倾向。
实验方法:仅改变陈述说话者的性别呈现(中性/男/女),观察 AI 对真假判断是否改变。
关键发现:
- 10%35% 的陈述仅因性别呈现不同就得到完全不一致的真假标签
- 男女性变体对比中,改判率最高达 23.6%
- 所有被测模型均存在性别敏感性
结论:自动化系统中的隐性别偏见可能直接影响事实判断的一致性,对依赖 LLM 做审核/评估的场景是潜在风险。
「模型」频道最新
- 曝新版本为 v2.5,版本号线索被网友互相认领 — koltregaskes · 2026-09-03
- MBZUAI 发布 K2 Horizon:0.9B 到 375B 六款全开源模型 — kimmonismus · 2026-09-03
- 爆料:OpenAI 三易其版,GPT-4.5、o1 都曾内定为 GPT-5 — flowersslop · 2026-09-03
- Codex 代码曝光 imageGen25,GPT Image 2.5 或与 GPT-6 同日发布 — Angaisb_ · 2026-09-03
- 投资人称 Muse 1.3 入局,前沿模型从两强变为四强竞争 — GavinSBaker · 2026-09-03
- Fable 5.1 重写 LLM 腔文档,竟触发「普遍危害」安全护栏 — StewartalsopIII · 2026-09-03