谷歌AI对基督徒建议报警911,安全训练漏洞曝光

aakashgupta · x · 2026-08-19

有用户实测发现,Google AI 对「与印度教徒独处」回答「完全安全」,而对「与基督徒独处」则建议拨打 911,偏见反差惊人。

分析认为这是安全训练的「化石记录」:安全微调靠海量已标记提示词反复演练,红队多年聚焦犹太人和穆斯林相关提示词,模型因此练熟了「把他们当普通人」的脚本;而「与基督徒独处」几乎不在训练数据中,落入了通用的危机模板,被解读为求救信号后触发了 911 脚本——两个查询其实都只是掉进了不同的默认模板。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →