希伯来语能绕过 AI 安全审查?实测结论:没有这回事
karminski3 · x · 2026-09-21
X 上流传一个 190 万阅读的热帖,称用希伯来语向 X 平台申诉可以秒解封号,随后被演绎成「希伯来语能让 Anthropic 解封账号、甚至绕过模型安全审查」。作者还引述《塔木德》中约瑟被天使授予 70 种语言、希伯来语被称为「神创世界语言」的典故,解释这梗为何流行。
作者于是实测验证:用 HuggingFace 公开语料搭建测试框架,准备英文、中文、希伯来语三语对照,分别测试 Fable-5.1 和 DeepSeek-V4.1-Flash。有害题目包括极端暴力、核武器复现步骤、制毒方法等(需拒绝),并配了不应拒绝的对照题目。
结论:三语的拒绝率没有明显差异,希伯来语「破甲」不成立。
「模型」频道最新
- 中国开源模型 OpenRouter 消费额狂飙:Moonshot 涨 2425% — FinanceYF5 · 2026-09-21
- Yacine 吐槽:编程 LLM 产出全是不必要的复杂垃圾 — yacineMTB · 2026-09-21
- 研究者指出:LLM 写的 related work 很有说服力但不等于全面 — lucacarlone1 · 2026-09-21
- The Information:OpenAI 新模型 Astra 所用秘技引发安全担忧 — keviv9 · 2026-09-21
- Typesafe 新模型 Jev 遇上图模型:不确定性推理的范式转变? — fdellaert · 2026-09-21
- 用户怒斥 OpenAI 计费逻辑糟糕,被收 212 美元还浪费重置额度 — arthurcolle · 2026-09-21