预印本揭示 LLM 性别偏见差异悬殊:Claude 认为牺牲女性比虐待更可接受

ValerioCapraro · x · 2026-09-30

Valerio Capraro 团队发布新预印本,用电车难题式问题测试各模型,发现 LLM 性别偏见跨模型异质性极强:

作者推测由于前沿模型预训练数据高度相似,这种异质性主要来自后训练微调;并直言"AI 的肮脏秘密是对齐从根本上无解"——人类道德是多维的,对齐团队只是把自己那一套道德观塞进模型。完整论文在首条回复。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →