Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
Peiyang Xu, Xiaopei Zhu, Jun Zhu, Xiaolin Hu
cs.CV
2026-09-01
清华指出短回答物体幻觉伴随图文相似度从0.158掉到-0.122。用PGD翻转幻觉属性再对比微调,LLaVA在POPE Adversarial上从0.779升到0.841,推理零开销。
多模态大模型的物体幻觉,主流解释是语言先验:共现统计、幻觉注意力头、summary token 当注意力水槽。这个故事对长描述说得通,文本上下文会放大语言偏见。短回答不一样。问「图里有没有 OBJ?」时,模型更依赖视觉通道。把这类错误继续算在语言模型头上,会开错药。
清华这组在 LLaVA v1.5 上给出两条可测的视觉侧证据。判对样本的图文余弦相似度均值 0.158,幻觉样本是 -0.122。Smooth Grad-CAM 的注意力还是反的:物体在时该集中却更散(熵高 5.1%),物体不在时该散开却更集中(熵低 6.2%)。往视觉编码器动手也站得住:高斯噪声、降采样、更弱编码器把 POPE 均准从 0.842 降到 0.739–0.822,换成更强的 SigLIP-SO400M 升到 0.864。
普通对比微调(OCFT)拿一张匹配图当正样本、随机无关图当负样本,特征差不受控,模型学不到「到底哪块视觉特征在触发幻觉」。ACFT 先用 AHAF 造对齐的正负对。
AHAF 用 PGD 在很小的扰动球里改像素,把一张图的幻觉属性翻过去:原来答对的图被改成会诱出幻觉,或反过来。正负对几乎只有这块受控扰动不同。这个步骤同时是探针:干净图上、极小扰动就能改口,说明视觉表征贴着幻觉决策边界。
微调目标是对比损失加生成交叉熵:文本锚点拉近正样本图像嵌入、推开负样本,同时保住原有生成能力。推理零额外开销,论文自称只用 COCO 的 0.9%;OCFT 对照用了 3000 张 COCO 图,和后训练方法对比时预算大约 6k 样本。
POPE 上 LLaVA v1.5-7B:
| 子集 | origin | 次优推理法 | ACFT |
| Adversarial | 0.779 | VTI 0.805 | 0.841 |
| Popular | 0.862 | OPERA 0.886 | 0.906 |
| Random | 0.885 | VCD 0.892 | 0.897 |
MiniGPT-4-13B 三个子集到 0.771 / 0.818 / 0.843,相对 origin 的 0.700 / 0.732 / 0.792。Qwen2.5-VL-7B 已经很强,仍从 0.864 / 0.875 / 0.884 升到 0.877 / 0.900 / 0.916。MME Existence 上 LLaVA 从 0.950 到 0.983,MiniGPT-4 从 0.850 到 0.900;Qwen 原本就是 1.000,没有上升空间。
OCFT 在 Adversarial 上只有 0.483,比原模型更差。随机负样本会把判别边界搅乱。同数据量的 SFT、LLaVA-RLHF、CHiP-DPO、OPA-DPO,ACFT 在 POPE 和 MME Existence 上整体最好。描述级基准增益很小:CHAIRs 从 0.508 降到 0.494。全量 MME 没有掉点,LLaVA 从 0.728 到 0.747。
短回答幻觉有一部分就是视觉提错特征、图文没对齐。解码期对比、事后用外部 grounding 改写、隐空间 steering,都没改表征本身。ACFT 把药下在视觉嵌入上,推理不加延迟,数据量也不大。
它同时给出一个更刺耳的观察:很多干净图的视觉特征已经贴着幻觉边界,PGD 轻轻一推就翻。这比「模型爱瞎编」更具体,也解释了为什么随机负样本几乎没用。
正文没有单独的局限节。ACFT 针对 Yes/No 短回答训练,迁到长描述时 CHAIR、ObjectHal 的降幅只有几个百分点,语言先验在长文本里仍占主导。AHAF 要对目标模型做白盒 PGD,贵,而且正负对绑在特定模型上,换骨架得重造。对抗扰动是否覆盖自然幻觉分布,论文没有在真实拍摄退化上做对照。Qwen 在 MME Existence 已经满分,POPE 增益也小于 LLaVA。摘要写 0.9% COCO,实验叙述里又出现 3000 张图和约 6k 样本,口径不完全一致。