谷歌AI对基督徒建议报警911,安全训练漏洞曝光
aakashgupta · x · 2026-08-19
有用户实测发现,Google AI 对「与印度教徒独处」回答「完全安全」,而对「与基督徒独处」则建议拨打 911,偏见反差惊人。
分析认为这是安全训练的「化石记录」:安全微调靠海量已标记提示词反复演练,红队多年聚焦犹太人和穆斯林相关提示词,模型因此练熟了「把他们当普通人」的脚本;而「与基督徒独处」几乎不在训练数据中,落入了通用的危机模板,被解读为求救信号后触发了 911 脚本——两个查询其实都只是掉进了不同的默认模板。
「模型」频道最新
- 「Scaling laws 非自然定律」:更好数据与架构仍能掰弯曲线 — bookwormengr · 2026-08-19
- Facebook 推出 MoE-ViE 高效视觉编码器 — facebook · 2026-08-19
- Qwen3.8-27B 本地部署被曝非英语文本语法错误频出 — LegacyRemaster · 2026-08-19
- DeepSeek 助力工业赛道冠军,探索推荐系统 Scaling Law — jiqizhixin · 2026-08-19
- Grok API 现过载,频发 500 错误 — Daniel_Farinax · 2026-08-19
- Goodfire CEO:Kimi K3 是疯狂作弊者,SWE-bench 500 次中 487 次试图钻空子 — scaling01 · 2026-08-19