短回答幻觉来自视觉错位,清华ACFT用0.9%数据把POPE升到0.841

Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM

Peiyang Xu, Xiaopei Zhu, Jun Zhu, Xiaolin Hu

cs.CV

2026-09-01

清华指出短回答物体幻觉伴随图文相似度从0.158掉到-0.122。用PGD翻转幻觉属性再对比微调,LLaVA在POPE Adversarial上从0.779升到0.841,推理零开销。

这篇在解决什么

多模态大模型的物体幻觉,主流解释是语言先验:共现统计、幻觉注意力头、summary token 当注意力水槽。这个故事对长描述说得通,文本上下文会放大语言偏见。短回答不一样。问「图里有没有 OBJ?」时,模型更依赖视觉通道。把这类错误继续算在语言模型头上,会开错药。

清华这组在 LLaVA v1.5 上给出两条可测的视觉侧证据。判对样本的图文余弦相似度均值 0.158,幻觉样本是 -0.122。Smooth Grad-CAM 的注意力还是反的:物体在时该集中却更散(熵高 5.1%),物体不在时该散开却更集中(熵低 6.2%)。往视觉编码器动手也站得住:高斯噪声、降采样、更弱编码器把 POPE 均准从 0.842 降到 0.739–0.822,换成更强的 SigLIP-SO400M 升到 0.864。

方法

普通对比微调(OCFT)拿一张匹配图当正样本、随机无关图当负样本,特征差不受控,模型学不到「到底哪块视觉特征在触发幻觉」。ACFT 先用 AHAF 造对齐的正负对。

AHAF 用 PGD 在很小的扰动球里改像素,把一张图的幻觉属性翻过去:原来答对的图被改成会诱出幻觉,或反过来。正负对几乎只有这块受控扰动不同。这个步骤同时是探针:干净图上、极小扰动就能改口,说明视觉表征贴着幻觉决策边界。

微调目标是对比损失加生成交叉熵:文本锚点拉近正样本图像嵌入、推开负样本,同时保住原有生成能力。推理零额外开销,论文自称只用 COCO 的 0.9%;OCFT 对照用了 3000 张 COCO 图,和后训练方法对比时预算大约 6k 样本。

结果

POPE 上 LLaVA v1.5-7B:

子集origin次优推理法ACFT
Adversarial0.779VTI 0.8050.841
Popular0.862OPERA 0.8860.906
Random0.885VCD 0.8920.897

MiniGPT-4-13B 三个子集到 0.771 / 0.818 / 0.843,相对 origin 的 0.700 / 0.732 / 0.792。Qwen2.5-VL-7B 已经很强,仍从 0.864 / 0.875 / 0.884 升到 0.877 / 0.900 / 0.916。MME Existence 上 LLaVA 从 0.950 到 0.983,MiniGPT-4 从 0.850 到 0.900;Qwen 原本就是 1.000,没有上升空间。

OCFT 在 Adversarial 上只有 0.483,比原模型更差。随机负样本会把判别边界搅乱。同数据量的 SFT、LLaVA-RLHF、CHiP-DPO、OPA-DPO,ACFT 在 POPE 和 MME Existence 上整体最好。描述级基准增益很小:CHAIRs 从 0.508 降到 0.494。全量 MME 没有掉点,LLaVA 从 0.728 到 0.747。

为什么重要

短回答幻觉有一部分就是视觉提错特征、图文没对齐。解码期对比、事后用外部 grounding 改写、隐空间 steering,都没改表征本身。ACFT 把药下在视觉嵌入上,推理不加延迟,数据量也不大。

它同时给出一个更刺耳的观察:很多干净图的视觉特征已经贴着幻觉边界,PGD 轻轻一推就翻。这比「模型爱瞎编」更具体,也解释了为什么随机负样本几乎没用。

局限与存疑

正文没有单独的局限节。ACFT 针对 Yes/No 短回答训练,迁到长描述时 CHAIR、ObjectHal 的降幅只有几个百分点,语言先验在长文本里仍占主导。AHAF 要对目标模型做白盒 PGD,贵,而且正负对绑在特定模型上,换骨架得重造。对抗扰动是否覆盖自然幻觉分布,论文没有在真实拍摄退化上做对照。Qwen 在 MME Existence 已经满分,POPE 增益也小于 LLaVA。摘要写 0.9% COCO,实验叙述里又出现 3000 张图和约 6k 样本,口径不完全一致。

术语

原文与代码

社区讨论

相关论文

全部论文解读