细粒度负向提问让MLLM频繁认错,InternVL3.5-14B配对准确率最多升24.2%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

CVPR 2026

cs.CV, cs.AI

2026-03-18

TUM与Google提出FINER两个细粒度负向提问基准。InternVL3.5-14B在CompreCap多关系设定上配对准确率从47.0%升到71.2%,八个旧幻觉套件和六个通用基准同步改善。

这篇在解决什么

多模态大模型在粗粒度「图里有没有狼」这类问题上还能拒答。问句一旦叠上多个物体、属性和关系,并把其中一处换成看起来合理但图里没有的细节,模型就容易跟着说有。POPE、DASH 盯的是单个物体是否存在,AMBER 的判别子集也是单物体、单属性、单关系。细粒度、多元素的负向提问几乎没人测。

慕尼黑工大、Google 和 Télécom Paris 把这类提问叫做 Fine-grained Negative Queries。动机实验把负向问句从粗到细拆成七档,每档只注入一处矛盾,答案永远是 No。InternVL3.5-14B 在 FINER-CompreCap 上从第 1 档约 80% 准确率掉到第 5 到 7 档约 20%,在 FINER-DOCCI 上从约 58% 掉到约 15%。粒度越细,假阳性越多。

方法

两套基准都从场景图出发。FINER-CompreCap 用 CompreCap 的人工场景图,图来自 COCO;FINER-DOCCI 从 DOCCI 的长人工标题里抽物体、属性、关系,抽取用 Gemini-2.0-Flash,再用 Qwen2.5-VL-72B 过滤。每个正实体生成四个语义上说得通、图里却没有的负替换,同样用强 MLLM 当判别器迭代重生,降低负例其实出现在图里的风险。

四个设定:

题型是五选一。正确项要指出图里真正有的元素,另外四项是同分量的其他负替换。每道负向题配一道对应正向题,两项都对才计分,这就是配对准确率 Accpaired,用来堵住「见题就答 No」的捷径。规模上,CompreCap 四类分别是 6300、3338、4280、3166 题;DOCCI 是 10000、28630、11542、20944 题。

FINER-Tuning 用同一思路造偏好数据,走 DPO。图来自 Pixmo 长标题,刻意避开 COCO 和 DOCCI 训练集。标注模型换成 Phi-4-14B,避免和基准构造用的 LLM 重叠。每条样本同时有正向问和负向问,接受回答先给对的 Yes 或 No,再说对的视觉细节,拒绝回答反过来。最多 16 万条偏好对,LoRA 训一个 epoch,β=0.1。backbone 是 LLaVA-1.6-7B、Qwen2.5-VL-7B、InternVL-3.5-8B 和 14B。

结果

旧幻觉微调方法在这套题上几乎动不了:LLaVA-RLHF 和 RLHF-V 在 CompreCap Multi-rel 上配对准确率只有 1.1% 和 1.6%。RLAIF-V-12B 是那一批里最好的,Multi-obj 62.2%,仍低于未微调的 Qwen2.5-VL-7B(69.2%)。

模型CompreCap Multi-rel微调后变化
InternVL-3.5-14B47.0%71.2%+24.2
InternVL-3.5-8B49.8%64.1%+14.3
LLaVA-1.6-7B7.6%24.2%+16.6
InternVL-3.5-38B(未微调)66.8%

14B 微调后的 Multi-rel 比自家 38B 高 4.4 个点。Wh 仍然难:DOCCI 上 InternVL-3.5-38B 只有 36.6%,Gemini-2.5-Flash 也只有 49.6%。元素越多越差,微调的增益也越大:14B 在 CompreCap 的 6 物体、3 属性、3 关系上分别多 8.3、19.1、28.1 个点。

迁到八个旧幻觉套件没有崩。InternVL-3.5-8B 的 DASH 从 68.3% 到 74.5%(+6.2),14B 从 55.8% 到 61.3%(+5.5)。LLaVA-1.6 的 HaloQuest 从 44.2 到 63.5(+19.3),AMBER 从 78.1% 到 85.0%(+6.9)。六个通用基准上 14B 均分从 68.0 到 69.4。对比之下,RLAIF-V 把 OmniLMM 均分从 46.3 拉到 45.7,对齐税在 FINER-Tuning 这批模型上没有出现。

消融更说明数据形态和损失要对上。同样数据改 SFT,InternVL-3.5-8B 的 Multi-obj 从 74.2% 掉到 37.5%。只用负向问做 DPO 已经好于基线,正负一起训才是满配。分设定单训能在对应测试上拿到最高分,四类混训最均衡。

为什么重要

MLLM 的幻觉评测长期停在「图里有没有这个物体」。真实用户问的是带一串细节的句子,错的往往只有一处。FINER 把这个缺口做成可刷的配对准确率,并且证明:用细粒度负向提问做 DPO,能同时修新基准、旧幻觉套件和通用能力。训练配方普通,Phi-4-14B 就能造数据,不必迭代调闭源多模态模型。

Wh 设定和高层级粒度仍然远低于不该认错的水平。这更像一张诊断图,不是已经治好的病。

局限与存疑

作者承认大规模基准没有全量人工验收;规则模板拼出来的选择题可能不像真人提问;Multi-rel 最多三个关系。负替换和 DOCCI 场景图都经过 LLM,残留噪声会让「模型错了」和「题本身糊」缠在一起。Gemini-2.5-Flash 在 DOCCI 上每档只测了 3k 题。配对准确率很严,一对里错一道整对记零,和普通准确率不能直接比。SFT 崩得那么狠,也说明这套数据更适合偏好学习,直接模仿容易把模型教歪。

术语

原文与代码

社区讨论

相关论文

全部论文解读