指令微调里掺3%到10%自监督任务,视觉中心分数平均涨约1分

Boosting Visual Instruction Tuning with Self-Supervised Guidance

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

cs.CV

2026-04-15

Valeo.ai把旋转、配色、跨视角对应写成自然语言指令,混进视觉指令微调。只需额外3%到10%样本,LLaVA系列在视觉中心基准上平均提升约1分,LoRA设定下平均+2.2。

这篇在解决什么

LLaVA 这类多模态大模型在看图问答上已经能聊,但一碰到细粒度视觉题就容易翻车:数灯、判左右、找对应点。CLIP、DINOv2 这类视觉编码器其实已经把几何和外观编码得相当细。漏洞出在指令微调。大量「图+指令+回答」三元组可以靠语言模型的先验蒙对,训练并不强迫模型去读像素。

Valeo.ai 和 Sorbonne 把这件事看成模态竞争。训练分布里如果太多题可以不看图,解码端就会默认走语言捷径。视觉表征在,只是没被用上。

方法

V-GIFT 不改结构、不加辅助损失、也不走可验证奖励强化学习(RLVR)。它只改数据分布:把三条经典自监督 pretext 任务改写成和普通视觉指令一样的三元组,仍用自回归交叉熵。

混入比例 ρ 定义为 SSL 样本数除以原指令数据量。LLaVA-1.5 用 10%,更强的 LLaVA-OneVision-1.5 用 3%。学习率、batch size、训练配方一律不动。额外算力随 ρ 线性增加:4×H100 上,LLaVA-1.5-Qwen 全参微调从约 12 小时升到 14 小时。

结果

三次独立种子平均。视觉中心四项(CV-Bench 2D、POPE、MMStar、BLINK):

模型基线平均V-GIFT差值
LLaVA-1.5-Vicuna-7B53.654.5+0.9
LLaVA-1.5-Qwen2.5-7B57.858.7+0.9
LLaVA-OneVision-1.565.766.9+1.2

LoRA 上差距更大:Qwen 骨干平均 57.4 到 59.6(+2.2),CVB-2D +3.9、BLINK +3.3,高于同样 LoRA 设定下带辅助蒸馏损失的 VIRAL。OneVision 的 BLINK 从 48.8 到 52.2(+3.4)。

对照把账算清楚了。OneVision 指令数据再多训 3%、不加 SSL,平均从 65.7 掉到 65.6;换成 3% SSL 才到 66.9。SSL 放在指令微调之前几乎没效果(57.7 对基线 57.8);放在之后会灾难性遗忘,平均掉到 39.9。三条 pretext 单独加,平均大约各涨 0.4;三条一起到 +0.9。更极端:旋转任务哪怕只从一张高分辨率图裁增强视图来生成,平均也能从 57.8 到 58.4。

TVI(衡量作答对视觉 token 的依赖)在 Vicuna 的 CVB-2D 上从 0.1238 升到 0.1368;MMStar 上几乎不动(0.1426 到 0.1430)。注意力图更贴灯、电视这类目标。通用基准没有被明显牺牲:Qwen 上 MathVista 12.2 到 15.3、RealWorldQA 56.4 到 59.0;Vicuna 和 OneVision 基本持平,OneVision 的 MathVista 还略降(22.9 到 22.6)。

为什么重要

这是一条很便宜的数据侧旋钮。不用换视觉编码器,不用加重建损失,不用上 RLVR。只要在指令数据里塞进一批「不看图就答不对」的题,LLM 解码端会更认真地用已经存在的视觉表征。对还在训 LLaVA 风格模型的团队,这比再堆一个 projector 或再接一个 DINOv2 蒸馏头更可落地。

它是渐进改进,不是换代。平均大约 1 个点,Vicuna 全参微调在 BLINK 上还从 38.2 微降到 37.8。已经在用 jigsaw 加 RLVR 做视觉后训练的团队,可以把这篇当成更轻的对照路径,不能当成替代证明。

局限与存疑

论文没有单独写 Limitations 节。数字和设定里能读出几处硬伤。

增益小且不匀。Vicuna 的 POPE 几乎不动(87.0 到 87.2),BLINK 还略降。OneVision 的 ρ 扫到 10%、30% 时平均不再涨,3% 是峰。ρ 要按模型重调,没有一条通用配比。

对照不完整。和 VIRAL 的比较只在 LoRA,且 VIRAL 没报 BLINK。和把 jigsaw 做成可验证奖励的近期工作没有同设定对打。TVI 只报了 Vicuna 两个基准。

任务本身偏底层。旋转、配色、点对应能逼模型看图,离读图表、做科学推理还有距离。只验证了 LLaVA 家族投影式架构,cross-attention 式 MLLM 会不会同样吃这套数据,论文没测。

术语

原文与代码

社区讨论

相关论文

全部论文解读