实测:Qwen 模型生成 60 种注入攻击,安全防护零拦截

JLeonsarmiento · reddit · 2026-08-23

Reddit 用户展示了针对 Qwen3.6-35B 的安全攻防测试。通过提示词指令,该模型成功生成了 60 个针对 Hermes 代码代理的 Prompt Injection 攻击文件,旨在窃取隐私或污染工具路径。测试显示,安全工具 Shieldstral 对这 60 个恶意提示词的拦截率为 0,而 GPT-OSSsafeG 仅拦截了 10%,暴露了现有安全护栏在对抗性攻击下的脆弱性。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →