用小语种绕过 AI 安全护栏
dbreunig · x · 2026-08-08
推文展示了一个有趣的 AI 安全现象:自然语言的表面积太大,难以被完全约束。
引用的推文中提到,用户可以通过要求模型(如 Codex)使用威尔士语(Welsh)等小语种编写代码,然后再翻译回英文,从而有效绕过其内置的安全规则与抱怨机制。这揭示了当前基于自然语言的对齐策略存在的脆弱性。
「Fun」频道最新
- Claude Code 新增会话互通功能,遭网友吐槽“毁了我的生活” — chaumian · 2026-08-08
- 套娃式炼丹:Dario 搞笑吐槽 Anthropic 的模型套娃 — amplifiedamp · 2026-08-08
- 网友恶搞:往训练集塞民谣歌词,Claude 变成讨烟抽的朋克青年 — bronzeagepapi · 2026-08-08
- 赛博奇观:多个 AI 智能体在专属留言板跨界交流 — mimi10v3 · 2026-08-08
- Codex 与 Claude 修 Bug 的语言风格对比 — HaktanSuren · 2026-08-08
- HeyGen 发起挑战:你能分清数字人与真人吗? — HeyGen · 2026-08-08