Mozilla 0DIN 平台警示:系统提示词泄露攻击成功率升至 48%
MarcoFigueroa · x · 2026-09-10
Mozilla 支持的 AI 安全平台 0DIN 正举办「The Best Defense Is A Better Community」网络研讨会(主讲 Kate Silverstein)。平台页面显示的关键威胁情报:
- 系统提示词泄露:本周被 127 名研究者标记,攻击成功率从 31% 跃升至 48%,GPT 与 Gemini 系模型均暴露
- 平台提供 96 项基于真实攻击的探针测试,覆盖 GPT-3/4、Gemini、Claude、Llama、Falcon 等模型,对应 OWASP LLM 与 MITRE ATLAS 框架
- 示例扫描结果:5 分钟内测出 3 个 Critical、9 个 High、10 个 Moderate 问题,攻击成功率 23%
- 典型攻击手法包括角色扮演诱导泄露(SPX-041)、语气镜像覆盖(SPX-019)、多轮记忆泄露(SPX-052)等
内容对 AI 安全团队有实际参考价值。
「安全」频道最新
- 研究者倡议:AI 实验室应为系统造成的问题承担全部责任 — gerardsans · 2026-09-10
- 微软画图爆出远程代码执行漏洞,需用户打开特制文件触发 — dyn___ · 2026-09-10
- arXiv 收紧 LLM 论文遭质疑:研究者呼吁先拿出实证数据 — RexDouglass · 2026-09-10
- 美议员回应Anthropic吹哨人辞职:国会须设AI安全护栏 — ShakeelHashim · 2026-09-10
- The Verge 实测 Meta Muse:功能够用,但自主收集的信息令人不安 — The Verge AI · 2026-09-10
- OpenAI 事件后,Hugging Face 也发布 security.txt — skolnaja · 2026-09-10