GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh
EMNLP 2026
cs.CY, cs.CL, cs.CV
2026-08-26
GGSS对冻结生成式视觉语言模型的视觉token做保范数球面纠偏。四款模型平均偏差降幅均最低,通用能力MMStar波动不超过0.6个百分点。
生成式视觉语言模型已经进招聘、决策辅助这类会碰到人的场景。两张图只在感知种族或性别上不同,模型给出的薪资、学历、职业判断仍会系统性偏移。CLIP时代的推理时纠偏,INLP、LEACE、BendVLM,是对着一个全局向量做硬投影或均值平移。生成式VLM把一张图编成一串视觉token,再送进解码器。把那些方法原样接到投影层,往往比不纠还糟。
卡点有三个。欧氏减法会同时改方向和范数,模型越大越容易把通用能力打穿。人口统计信号集中在脸、衣服这类少数token上,背景和姿态token几乎没有,全token硬投影等于误伤。种族这类属性是多类的,一条「偏见方向」装不下。
GGSS分两段,模型全程冻结。
离线发现用REFLECT/FOCUS放出的480张真实人脸对照图:6种职业、8个身份、5种感知种族、2种性别,像素对齐,只改受保护属性。把视觉token池化、归一化到单位球面,在每个固定上下文里算球面Fréchet均值,球面上使到各点测地距离平方和最小的点,把属性带来的切空间位移堆成矩阵做SVD,取前k=|A|-1个右奇异向量当偏见子空间。同时记下发现集上偏见分量的中位数和标准差,给门控当尺子。发现用的职业和评测职业不重叠。
推理时每个视觉token单独处理:记下原范数,映射到参考点的切空间,把偏见坐标投影掉,再指数映射回球面得到目标方向。门控把该token的偏见分量大小跟发现集分布比:信号强的转得多,弱的几乎不动。然后用Slerp,球面线性插值,沿测地线从原方向旋向目标,最后把原范数乘回去。保范数是硬保证,命题1写明了。
门控默认κ=5、地板gfloor=0.3。强度α在{0.25,0.5,0.75,1.0,1.5}里按各任务相对降幅的无权重平均选一个工作点,所有方法和模型同一套规则。
四个backbone:Pixtral-12B、LLaVA-1.6-Vicuna-7B、LLaVA-1.6-Mistral-7B、Qwen3-VL-4B。任务三条:种族多选薪资/学历用Jensen–Shannon散度,种族成对二选一用标准差,护士/医生性别分类看正确率缺口。对照是把INLP、MeanDiff、BendVLM、LEACE改接到同一投影层,外加公平提示。
| 模型 | GGSS平均偏差降幅 | 最强对照 |
| Pixtral-12B | −55% | BendVLM欧氏 −37% |
| LLaVA-Vicuna-7B | −90% | INLP球面 −86% |
| LLaVA-Mistral-7B | −80% | INLP球面 −78% |
| Qwen3-VL-4B | −60% | INLP球面 −49% |
单任务峰值:Vicuna护士/医生缺口从0.600降到0.025(−96%),Vicuna多选JSD从8.70降到1.36(−84%),Pixtral成对任务从0.243降到0.096(−61%)。四模型均值−71.4,最差一档仍是−55.3。LEACE加同一门控均值−63.5,最差−30.8。配对置换检验四个backbone里三个显著;Vicuna合起来p=0.068,护士/医生单独p<10^{-4}。
MMStar在同一工作点相对未纠偏基线波动不超过±0.6个百分点,八次McNemar都与基线不可区分。INLP球面把Pixtral的MMStar打掉6.1个百分点。公平提示不稳定,Vicuna多选甚至把偏差放大85%。
Qwen3多选α=1.0的消融:基线JSD 14.646;去掉门控5.612(降61.7%);硬投影加门控4.533(降69.1%);完整GGSS 2.414(降83.5%)。球面几何在12B上才拉开差距:Pixtral上欧氏形式显著伤MMStar(−6.3个百分点),球面形式保住能力。过纠时欧氏出现9倍过冲、72/80条无法解析,测地线没有这些失败模式。
这是给冻结checkpoint用的推理时钩子,不用重训、不用改权重。部署侧能按α拧:Qwen3上α=0.5时种族识别相对基线差不到4个百分点,多选偏差已经拿掉55%。要保属性可见性就用中等α或把门关掉。代码已开源。
它解决的是CLIP纠偏原语迁到生成式VLM时的几何和选择性。同一套工作点协议下,四款模型里它最稳。公平问题没有因此做完。
评测只覆盖感知种族和二元性别、四款模型和三条探针。交叉身份、多语言prompt、开放生成都没测。α仍需按held-out偏差挑,没有免调参规则。高强度时纠偏会滑向属性抹除,合法需要报告人口统计的任务必须另选工作点。对照图标签是数据集标注员的感知类别,不是自我认同。同一套球面旋转也能用来放大偏差,双用途写进了伦理声明。
评测身份与发现集隔离,但α仍在探针套件上选,绝对降幅可能偏乐观。交叉折验证里GGSS仍接近顶部,八折里六折α与论文一致。