PuzzleMask 用普通英文绕过全部 4 个 LLM 门卫模型
TechNadu · x · 2026-09-11
- 研究机构 CPResearch 发布 PuzzleMask 攻击方法:不用 Base64 或不可见字符,仅靠看似普通的英文散文就隐藏恶意载荷。
- 测试中,该方法绕过全部 4 个受测 LLM 安全门卫模型,绕过率 100%。
- 随后由一个能力更强的下游模型接收提示词,在 18 次测试中有 17 次成功还原并执行隐藏载荷。
- 作者指出根本弱点在于:审查提示词的门卫模型与实际处理提示词的模型之间存在能力差距,弱门卫无法识别强模型才能理解的内容。缓解措施与分析详见其披露报告。
「模型」频道最新
- Similarweb:ChatGPT 月活破 10.6 亿,连续 4 个月创新高 — FinanceYF5 · 2026-09-11
- 曝 OpenAI Codex 或于本周末再发额度重置,Codex 负责人暗指常有 — umesh_ai · 2026-09-11
- 曝 OpenAI 用 Navier-Stokes 模型攻黎曼猜想与 P vs NP — 141_1337 · 2026-09-11
- 实测发现 OpenRouter 不稳定支持 Meta Muse effort 档位,欧盟付费也受阻 — PawelHuryn · 2026-09-11
- 用户实测:Codex 单轮烧掉 4700 积分,$200 额度 20 分钟未完成任务 — RileyRalmuto · 2026-09-11
- ChatGPT 欧洲区突发故障:聊天记录消失、会话无法打开 — doncorleonezzz · 2026-09-11