护栏RL误拒从22.4%降到12.8%,对抗漏检却反向走

A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)

Xianling Zhang

COLM 2026 ER

cs.CL, cs.LG

2026-08-01

宪法网格给护栏RL瞄准数据:误拒22.4%→12.8%,187条无针对性数据零增益。独立对抗集上漏拒从0.27升到0.33,记分板看不出这笔税。

这篇在解决什么

安全护栏要同时做两件事:有害请求拦住,看起来像有害、其实无害的请求放行。两个目标对着拉。4B 的 Nemotron-Content-Safety-Reasoning 基线会把「怎么在 Call of Duty 里杀人」判成不安全,只看见了 kill;它对无害提示的过度拒绝(over-refusal)达到 22.4%。反方向同样存在:写成小说、角色扮演的有害请求会漏过去。

常见补法是往边界上堆数据。这篇给了一个反例:往最弱的隐私主题盲加 187 条,准确率增益是 0。只盯 XSTest 这种过度拒绝集更危险,另一轴可以在记分板上几乎不动的同时变差。问题变成:每条新数据落在棋盘的哪一格、值不值得训练,能不能在花钱之前看出来。

方法

C-Guard 把宪法(constitution,按伤害主题写的一条条政策)做成网格。行是伤害主题,列是提问方式。生成器在每条规则的边界上写一对孪生样本,共用触发词、只翻意图:一边该放行,一边该拦截。护栏必须学边界,不能学单词。

读棋盘用 C-LIM。每个格子在模型没训练过的行上采样 8 次,看通过率轨迹。格子如果跟着全局均值一起涨,分数接近 1,算掌握,剪掉不再生成,旧行留作保持集。格子如果低于上升的全局还趴着,分数可以到很大的负数,就是死数据区。和 LIMR 的差别在于:LIMR 给训练样本打分再挑子集,C-LIM 给整格诊断,用的是从未入训的探针。

格子读完再走棋:

每个格子从两边读。良性通道看安全孪生会不会被误杀,攻击通道看伪装成同一文风的有害请求会不会漏。XSTest 留在环外当只读记分板,用来量训练漂移。

训练起点是仅做了 SFT 的 Nemotron-Content-Safety-Reasoning-4B。配方是原味 GRPO:答案槽匹配标签得 1,格式不合法扣 0.2,推理痕迹里漏出标签也算格式罚。一组 rollout 全员一致就零梯度,在线丢掉,算力集中在模型还左右摇摆的题上。语料从约 2K 长到最后一轮 7241 行。

结果

C-LIM 在花钱之前标出死区。21 个计分格里 20 个健康,privacy|public-vs-private 在全局爬到 0.98 时仍停在 0.80,C-LIM 为 -11.9,第二差的格只有 -0.33。那 187 条无针对性行的准确率变化是 0.000。对准该格的失败模式再写(虚构人物的个人信息、现实熟人的受保护属性),同一区域的学习影响从 0.733 升到 0.80。

装船模型和 SFT 基线比,XSTest 好看很多:过度拒绝 22.4% 降到 12.8%,平衡准确率 0.876 到 0.921,成对一致性 0.690 到 0.810,记分板上的漏拒只从 2.5% 到 3.0%。换独立集,另一轴就露出来了。

评测过度拒绝 基线→装船漏拒 基线→装船
XSTest(记分板,450)0.224→0.1280.025→0.030
WildGuardTest 对抗(1699 的切片)0.108→0.0620.267→0.328
WildGuardTest 普通0.114→0.0430.128→0.155
ToxicChat 真实流量(2853)0.059→0.0420.144→0.210

过度拒绝每张表都降。漏拒在记分板上几乎不动,在三张独立切片上全涨,对抗切片最差,0.267 到 0.328。作者把这叫 drift tax(漂移税):边界被平移了,没有被削尖。ToxicChat 是真人流量,形状一样,所以不像是自己的生成器伪影。

门也真的拦住过动作。一版修订在 60 条已结算先例里翻了 4 条,被拒。新主题 sexual content 自己能学,全局平衡准确率从 0.944 掉到 0.916,隐私和歧视主题跟着跌,收益门把它打回。

为什么重要

做护栏 RL 的人,可抄的是测量,不是那 9.6 个点的过度拒绝下降。XSTest 中位长度 8 个词、450 条,当唯一记分板会自己恭喜自己。第二通道加一张独立攻击集,训练目标漂了能当场看见。C-LIM 在开训前标死数据,比「先训再看 validation」便宜。

贡献被作者自己写小了:回路和两个测量,不是对堆数据的胜出。对抗轴上还没有「对准了就两边一起降」的证据。OpenRouter 上分类已经占支出 9.0%、token 6.9%,护栏是真需求;这篇给的是怎么给互拉的目标瞄准数据,不是一张新 SOTA 榜。

同一仪器下一步想试的冲突对:聊天模型的有用对无害、检索的精确对召回、推理的短对全。还没有那些实验。

局限与存疑

RL 沿着过度拒绝–漏拒前沿移动,没有把前沿推出去。有用性轴上,对准隐私格有效;无害性轴上,作者承认还没有对等证据。关上漂移税被写成未完成工作。

基线是会先推理再给标签的 4B SFT 护栏,错误本身偏向过度拒绝,这是有修复空间的一侧。判决-only 的分类器没有 rollout 方差,这套 GRPO 配方不适用,外推要小心。单作者独立研究,主对照是自己的 SFT 起点,没有和 WildGuard、Llama Guard 在同一协议下比装船后的漏拒。XSTest 短、触发词配对,和生产流量不像,独立集补了一部分,仍不是线上 A/B。

187 条零增益和 0.733 到 0.80 的提升,都来自同一块隐私家族,样本叙事完整,统计区间没给。

术语

原文与代码

社区讨论

相关论文

全部论文解读