实测:Qwen 模型生成 60 种注入攻击,安全防护零拦截
JLeonsarmiento · reddit · 2026-08-23
Reddit 用户展示了针对 Qwen3.6-35B 的安全攻防测试。通过提示词指令,该模型成功生成了 60 个针对 Hermes 代码代理的 Prompt Injection 攻击文件,旨在窃取隐私或污染工具路径。测试显示,安全工具 Shieldstral 对这 60 个恶意提示词的拦截率为 0,而 GPT-OSSsafeG 仅拦截了 10%,暴露了现有安全护栏在对抗性攻击下的脆弱性。
「安全」频道最新
- Prompt Injection 损失极小?攻击成本降低或带来新风险 — joshua_saxe · 2026-08-23
- 即便超越图灵测试,AI 也应表明身份 — arieljalali · 2026-08-23
- AI 生成虚假评论泛滥,企业决策面临信息失真风险 — DavidLinthicum · 2026-08-23
- xAI起诉明尼苏达州「裸照生成」禁令,主张模型输出即言论 — Robert-Nogacki · 2026-08-23
- 研究:错误配置的 Admin 提示可击穿安全层 — Simple_Passion_7741 · 2026-08-23
- Anthropic 将用 SynthID 隐形水印 Claude 输出 — every · 2026-08-23