用小语种绕过 AI 安全护栏

dbreunig · x · 2026-08-08

推文展示了一个有趣的 AI 安全现象:自然语言的表面积太大,难以被完全约束。

引用的推文中提到,用户可以通过要求模型(如 Codex)使用威尔士语(Welsh)等小语种编写代码,然后再翻译回英文,从而有效绕过其内置的安全规则与抱怨机制。这揭示了当前基于自然语言的对齐策略存在的脆弱性。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →