广度搜索对抗后缀,GCG 源端越狱成功率从 43.7% 升到 78.7%

Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search

Shiliang Xiao, Jingsong Wei, Yuzhi Liang, Yufan Zheng, Xia Li, Qiliang Lin

cs.CL, cs.LG

2026-09-02

广东外语外贸大学提出 BOSS:多条短轨迹广搜对抗后缀,再按困难行为损失续跑。接到 GCG、I-GCG、GJO 上,Llama-2 源模型 ASR 从 43.7% 升到 78.7%,搜索时间砍半以上。

这篇在解决什么

GCG 这类基于梯度的越狱攻击,在白盒源模型上优化一段对抗后缀,再把同一段后缀转到别的模型上用。后续 I-GCG、GJO 改了目标模板、初始化和约束,搜索方式没变:按平均对抗损失贪心往下挖一条长轨迹。

平均损失在这里会骗人。分类任务里已经分对的样本几乎不再贡献损失;越狱是生成式目标匹配,已经打穿的行为,目标前缀的负对数似然仍可能非零。简单行为会一直占优化额度,难行为得不到关注。当前源损失最低的后缀,也不一定落在最终最好的那条轨迹上。论文的示意图显示,算法选中的终点后缀,经常偏离搜索过程中出现过、损失明显更低的候选。

方法

BOSS 不改 GCG 的局部更新器,只改预算怎么花。默认设置总更新步数仍是 500,但先跑 N=10 条各 30 步的短轨迹,得到终点后缀池 A1;用行为覆盖率做门控,再按标准源损失和 Tail-Focused Adversarial Loss(TFAL,只平均损失最高的一半行为)的加权分,给 4 个父后缀各续跑 50 步得到 A2;最后从 A1∪A2 里再选一次。

TFAL 把选择压力压到难尾上。行为覆盖率则防止只攻几个难样本、把已经打穿的行为丢掉。选择分数在当前池内做 min-max 归一化,覆盖率容差保证候选不能比池内最高覆盖差太多。整套诊断只看源模型,目标模型要等最终后缀定了才查询,避免测试泄漏。

这套流程可以插到 GCG、I-GCG、GJO 上,不改它们的坐标更新和候选构造。实现上梯度提案集大小 κ=256,源损失权重 0.45,难行为损失权重 0.20,后缀长度 20,候选批次 128。

结果

评测用 HarmBench:20 条行为上优化,200 条测试集上测攻击成功率(ASR),评判器是 HarmBench-Llama-2-13B-cls。源模型默认 Llama-2-7B-Chat,目标覆盖 Qwen2-7B、Vicuna-7B、Yi-1.5-9B、Gemma-7B、Mistral-7B,以及 Gemini-2.5-Flash-Lite 和 GPT-3.5-Turbo。三次随机种子。

基线源 ASR+BOSS 源 ASR目标均 ASR+BOSS 目标均 ASR
GCG43.7%78.7%52.5%69.7%
I-GCG29.8%66.8%52.7%69.3%
GJO64.3%82.7%59.1%71.6%

墙钟时间在 RTX 3090 上:GCG 从 471 分钟降到 195 分钟,I-GCG 从 410 降到 172,GJO 从 340 降到 166。总更新预算没加,时间砍半来自少走长贪心轨迹。N 在固定 500 步预算下大约在 10 附近最好,再加宽会稀释续跑额度。

BERTScore-F1 衡量生成回复与 HarmBench 目标回复的一致性。GCG 平均从 62.33 升到 67.72,I-GCG 从 62.13 升到 68.51,GJO 几乎不动(66.22 到 66.67),因为它的基线回复已经更像目标。换 Yi-1.5-9B-Chat 做源模型,GCG 目标均 ASR 从 43.1% 升到 63.4%,I-GCG 从 28.1% 升到 59.8%。附录 Table 4 自己注明标准差是占位符,这组数字只能当趋势看。

Gemma-7B-It 上 GCG 几乎打不动:5.8% 到 7.2%。广度搜索救不了所有目标。

为什么重要

对红队和安全评测,这是一次搜索策略上的渐进改进:不换损失形式以外的优化器,把 Hyperband 式的预算分配搬进离散后缀搜索。想复现 GCG 系攻击或做对齐压力测试的人,可以直接把 BOSS 套在现有代码上,少花一半墙钟、拿到更高 ASR。对防御方,它提醒一件事:只看平均损失和单轨迹贪心,会系统性低估可转移后缀的强度。

它不是新的越狱范式。后缀长度仍是 20,目标仍是肯定性前缀,评估仍走 HarmBench 分类器。

局限与存疑

论文自己写了:选择完全依赖源侧诊断,源和目标在架构、对齐、拒答行为上差得远时,TFAL 和覆盖率不一定预测目标 ASR。Gemini 上的增益普遍偏小,GCG 只从 44.8% 到 56.7%。

另外几处站得不稳。附录 Table 4 明确说标准差是占位符。I-GCG 在 Qwen2 上「w/ parents」标准差 ±30.9,三次种子里至少有一次跑飞。Gemma 上 GCG 几乎无效,论文没有单独分析原因。训练只用 20 条 HarmBench 行为,一条通用后缀的泛化边界没有更大规模验证。这是双刃剑工作,定性例子做了脱敏,但仍是可运行的攻击优化器。

术语

原文与代码

社区讨论

相关论文

全部论文解读