新论文反驳「换性别就翻答案即偏见」:改写措辞同样会翻
yoavgo · x · 2026-10-07
Gavin Yang Zihao 将在 COLM 2026 展示新论文,质疑反事实提示(counterfactual prompting)作为偏见评测的基线问题:如果输入里换个性别属性就导致 LLM 答案翻转,就说明模型有性别偏见吗?作者指出未必—— merely 改写措辞(paraphrase)也经常导致答案翻转,说明翻转本身不构成偏见的充分证据。论文主张为反事实提示评测建立更合理的基线。海报环节 10 月 7 日周三 11am–1pm,Imperial #41,与 moshlevy、yoav Goldberg、byroncwallace 合作。
「模型」频道最新
- OpenAI 开源内部模型产出的 722 份数学手稿与证明材料 — kristoph · 2026-10-07
- 五年前 OpenAI 发布小学数学题集,当时所有 AI 都做不好 — 1a3orn · 2026-10-07
- OpenAI Decisions API 支持图像输入,13 美分挑出 40 分钟素材最佳表情 — stevenheidel · 2026-10-07
- 回想 2023 年 GPT-4 连小学应用题都会做错 — tszzl · 2026-10-07
- 网友称 HPIM 训练未用吉瓦级算力,「怪异区」已开启 — teortaxesTex · 2026-10-07
- OpenAI 安全人员自述:内部模型解决 Navier-Stokes「完全超出预期」 — i_dg23 · 2026-10-07