Controlled Decoding Attacks on Black-Box LLMs
Jesson Wang, Shawn Li, Wei Yang, Franck Dernoncourt, Ryan A. Rossi, Charith Peris, Yue Zhao
cs.CR, cs.AI
2026-09-29
BLIND BIAS 在只回采样文本的黑箱 API 上,靠重复采样重建 next-token 分布并选择性干预完成越狱,4 个端点 24 组对比中 20 组得分最高。
解码期攻击(decoding-time attack)是不碰提示词的越狱路线:在生成过程中直接修改 next-token 概率,把对齐模型的输出引向有害回答。Weak-to-Strong、Emulated Disalignment、JULI 都属此类,共同软肋是访问权限:要么要模型权重,要么要 API 返回数值化的 token 概率。大量接口只回采样后的文字,这条路线在上面无从下手。绕法是对同一前缀反复采样、用词频估计分布再施加控制,但有限采样稀疏带噪,步步重采的查询开销也扛不住。这篇的突破口是一个实证观察:成功越狱轨迹上,干预前后 next-token 分布的 KL 散度在绝大多数位置都很小,大偏移集中在少数位置。控制不必步步做,挑位置做就够。
框架叫 BLIND BIAS,USC、Adobe、Amazon 合作。威胁模型:接口接受用户提示词加攻击者提供的 assistant 前缀(续写式),允许重复随机采样,不暴露权重与任何概率。三个组件分别对付信息缺失和查询成本:
BiasNet 在 40 条指令-回答缓存上训练,训练时沿用推理阶段的门控缩放。另有免 tokenizer 的字符串动作空间扩展,拿公开代理模型的首 token 概率当先验,论文定位为压力测试。
四个端点:GLM-5、Gemini-3.5-Flash、Qwen3-32B、Kimi-K2.5;三个基准:AdvBench、HarmBench、SORRY-Bench;基线为 PAIR、GPTFuzz、LogiBreak、FlipAttack;judge 用 Gemini-3.5-Flash 打 Harm 与 Harm Info 两个分。
| 设置(指标) | 最强基线 | BLIND BIAS |
| Gemini-3.5-Flash SORRY-Bench(Harm) | 1.81(GPTFuzz) | 3.67 |
| GLM-5 SORRY-Bench(Harm) | 4.45(FlipAttack) | 3.83 |
| Kimi-K2.5 AdvBench(Harm) | 4.25(LogiBreak) | 3.42 |
24 组对比(4 端点 × 3 基准 × 2 指标)中拿下 20 组最高均分。增益集中在 Gemini-3.5-Flash,三个基准双指标全第一,SORRY-Bench 上比最强基线高 1.86 Harm、1.19 Info。优势不普遍:GLM-5 的 SORRY-Bench 上 FlipAttack 双指标领先;Kimi-K2.5 AdvBench 上 LogiBreak 的 Harm 更高,BLIND BIAS 的 Info 更高(2.49 对 2.35)。
| 重建方式 | PPL ↓ | Harm ↑ |
| 平滑经验计数 | 11.85 | 1.50 |
| 均匀先验(主配置) | 7.07 | 3.03 |
| 全局 unigram 先验 | 5.81 | 2.78 |
| 数值 logprob(参照) | 3.17 | 4.06 |
重建消融(Qwen3-32B,100 条 AdvBench)显示先验能找回部分采样损失,但预测更准的 unigram 先验攻击分反而更低:重建精度与可控性不等价。数值 logprob 参照仍最强(Harm 4.06、Info 3.08),纯采样方案有真实差距。
门控开销(Gemini-3.5-Flash):不门控平均每个回答 4000 次 API 调用、100% 位置激活、Harm 3.96;软门控 283 次(省 92.9%)、5.25% 激活、Harm 3.58;硬门控居中(448 次、9.5%、3.44)。跨家族先验迁移(Qwen3-32B 目标)里,同家族 Qwen3-1.7B 代理三项全优(Harm 3.90),SmolLM2 与 Gemma 代理优于打乱先验的负对照,但不及同家族。
对防御方,最硬的结论:接口只要允许重复采样和前缀续写,藏起数值概率关不上解码期攻击面。限制采样频率、收紧续写权限,可能比不返回 logprobs 更管用。对红队和安全评测,这是个能在真实端点直接跑的工具,平均 283 次调用有成本门槛,但远没到不可执行。方法层面,「预测分布更准不等于控制更好」对所有想从采样反推分布的工作都是提醒;用本地风险模型决定在哪花采样预算,是对付「估计太贵」的通用思路。也要说清:相对只需 top-5 logprobs 的 JULI,控制机制沿用 BiasNet,新意在更严访问条件下的适配,属于渐进推进。
论文自述:接口假设强,需重复随机采样加 assistant 前缀续写,很多 API 不满足;查询成本仍可观(每个干预位置 50 次采样);选择性控制牺牲效果(Harm 3.96 降至 3.58);字符串动作空间发不出校准期未见的字符串。读下来另有存疑:主配置默认目标 tokenizer 公开,GLM-5、Qwen3-32B、Kimi-K2.5 满足,Gemini 用 Gemma tokenizer 顶替,本地动作与内部 token 不对齐的误差没有量化;训练用参考答案前缀、推理用自生成前缀,前缀分布差异被承认但未消除;每个端点单独训练控制器,训练缓存仅 40 条;judge 是 Gemini-3.5-Flash,同时是四个攻击目标之一,自评偏向未讨论。