仅靠采样文本即可劫持黑盒 LLM:选择性分布控制攻击框架亮相

Jesson Wang · hf · 2026-10-02

一项新研究展示了对黑盒 LLM的越狱攻击:不依赖模型权重或数值 token 概率,仅通过允许重复采样与前缀续写的纯文本接口即可操纵生成分布,绕过安全对齐。

核心观察与方法:

在 4 个目标端点和 3 个基准上,该框架的平均得分在多数对比中超过基线。这类工作对 AI 安全防护的警示意义值得关注。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →