仅靠采样文本即可劫持黑盒 LLM:选择性分布控制攻击框架亮相
Jesson Wang · hf · 2026-10-02
一项新研究展示了对黑盒 LLM的越狱攻击:不依赖模型权重或数值 token 概率,仅通过允许重复采样与前缀续写的纯文本接口即可操纵生成分布,绕过安全对齐。
核心观察与方法:
- 经验发现:成功越狱轨迹上的大幅分布变化集中在少数关键位置,因此可做选择性控制;
- Sample-Based Distribution Reconstruction:用采样输出加上对未见动作的先验,重建出可用的控制信号;
- Risk-Gated Residual Control:根据当前响应前缀判断何时重建并修改分布,把采样成本集中在选定位置;
- Speculative Multi-Token Execution:验证并接受无需干预的草稿前缀,摊薄目标模型调用成本。
在 4 个目标端点和 3 个基准上,该框架的平均得分在多数对比中超过基线。这类工作对 AI 安全防护的警示意义值得关注。
「安全」频道最新
- OpenRouter 自查发现 85 名员工挂千余枚 API 密钥,推出安全中心 — AccBalanced · 2026-10-02
- open weights 被称危险?网友:历次「危险」技术都动了信息控制 — 0xAllen_ · 2026-10-02
- 无审查版 Abliterated Large V2 上线 Venice,面向安全研究匿名开放 — 0xAllen_ · 2026-10-02
- 微软 2026 数字防御报告:AI 加速攻击手法,52.2% 入侵追窃更多凭证 — AccBalanced · 2026-10-02
- Meta Muse 可接入 Tailscale 网络当节点,权限管控照常生效 — AccBalanced · 2026-10-02
- 限制提示注入爆炸半径:从零权限默认架构做起 — AccBalanced · 2026-10-02