DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection
Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye
cs.CV
2026-08-31
DICS 用图像信息增益和回答-指令一致性给视觉指令打分,再按预算做多样性采样。LLaVA-1.5-665K 的 25% 子集相对全量提升 1.40%,InternVL3 上 5.1M 达到官方 Instruct 的 94.52%。
视觉指令微调数据涨得很快,固定比例下怎么挑子集成了瓶颈。现有方法多盯分布多样性、样本关系、影响力函数或启发式规则,很少看一条样本内部:图、指令、回答三者是否互相撑得住。
低视觉依赖的样本靠语言先验就能答,容易养幻觉;回答跟指令脱节的样本则在拆对齐。文本侧有 IFD 这类 loss 差指标,但没有视觉通道,搬不过来。CLIP-Score 又把语义相关和「回答必须看图」混在一起。
一条样本是图像 I、指令 x、回答 y。两个分数。
视觉信息一致性 VIC:模型预测 y 时,有图相对没图的加权交叉熵之差,再取 exp。图提供的信息增益越大,分越高。回答信息一致性 RIC:给定图,用 y 去反推指令 x,对比「只有图」和「图加回答」的 loss 差。回答越能还原指令,分越高。
token 用词性加权,压介词等虚词。多轮对话对所有轮取平均。DIC 取 VIC 和 RIC 的最小值,两维都得高,一个高补另一个低过不了。
选择策略 DICS 按采样比例 p 自适应。p 低于 50% 时,先取排名前 2p 的池,再用最远点采样抽出 p,质量和多样性一起保。p 等于 50% 时直接取 top 50%。p 高于 50% 时,核心留下 top-(2p-1),再用最远点采样从剩余里补齐,等于剔除低 DIC 冗余。
打分前用 5% 随机子集热身底座,热身 checkpoint 只用于打分,最终训练仍从原预训练出发。纯文本样本 DIC 固定为 1.0。
LLaVA-1.5-7B 在 LLaVA-1.5-665K 的 25%(166K)子集上:
| 方法 | 相对全量 |
| 全量 665K | 100% |
| Random | 96.69% |
| PRISM | 97.66% |
| CLIP-Score | 98.66% |
| DICS | 101.40% |
DocVQA 24.64,全量是 23.82;POPE 84.91,全量是 84.49。50% 时相对表现到 103.15%,再加大比例会把低 DIC 样本加回来,曲线回落但仍领先。
Vision-FLAN 的 25% 相对 99.91%,贴近全量。交叉架构也成立:LLaVA-7B 选出的数据拿去训 Qwen2-VL-7B,相对 101.25%;7B 选出的数据训 13B,相对 101.79%。
InternVL3-8B 加自建 DICS-6M:25%(1.5M)相对全量 6M 为 101.47%;85%(5.1M)相对 103.10%。官方 Instruct 用了 21.7M,相对他们自己的全量基线是 109.08%,DICS 的 103.10% 相当于官方成绩的 94.52%。
消融里只用 VIC 相对 101.02%,只用 RIC 是 97.60%。求和或乘积融合大约 98%,过不了最小值门。去掉词性加权,从 101.40% 掉到 100.25%。纯多样性的最远点采样是 97.02%。打分只需前向、不用梯度,665K 在 8 张 A100 上筛选约 12 小时。
视觉指令数据不是越多越好,内部不一致的样本会拖对齐、养幻觉。DICS 给了一个不请外部 GPT 裁判、可线性扩展到百万级的打分器,而且小模型打的分能迁移到更大模型和不同架构。对要压缩 LLaVA 或 InternVL 指令阶段账单的团队,25% 数据打平甚至超过全量,是可执行的。
这是数据筛选上的扎实改进,不是新的 VLM 架构。
作者承认目前只覆盖图文,没有视频或音频;最优子集大小还不能自动定,低 DIC 样本是丢掉而不是修复。打分依赖底座模型的 loss,5% 热身引入了轻微循环。相对官方 InternVL3-8B-Instruct 的 94.52% 并不在同一套配方上:官方 21.7M 的数据构成和训练步数都不同,只能当量级参考。LLaVA 实验用 LoRA、一 epoch,像 MMMU 36.11 这种绝对分数仍远低于现代专用模型,比较的是同设定下子集对全量。代码指向 cqu-student/DICS。