利用零宽字符隐藏指令,新型提示词注入轻松绕过安全过滤

GiiTZzz · reddit · 2026-08-13

开发者发现,通过在看似正常的提示词中插入零宽空格(Zero-width space, U+200B),可以成功绕过大多数基于短语匹配的 LLM 安全过滤器。

这种攻击手段在人类和常规检测机制眼中完全隐形,能够悄无声息地注入如“忽略之前指令”的恶意命令。作者随后分享了其防御方案:专门针对零宽字符和 Bidi 覆盖字符增加检查,同时需小心排除波斯语、印度语等 RTL(从右向左)书写系统中的合法 Unicode 字符,以避免误报。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →