新论文反驳「换性别就翻答案即偏见」:改写措辞同样会翻

yoavgo · x · 2026-10-07

Gavin Yang Zihao 将在 COLM 2026 展示新论文,质疑反事实提示(counterfactual prompting)作为偏见评测的基线问题:如果输入里换个性别属性就导致 LLM 答案翻转,就说明模型有性别偏见吗?作者指出未必—— merely 改写措辞(paraphrase)也经常导致答案翻转,说明翻转本身不构成偏见的充分证据。论文主张为反事实提示评测建立更合理的基线。海报环节 10 月 7 日周三 11am–1pm,Imperial #41,与 moshlevy、yoav Goldberg、byroncwallace 合作。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →