MLLM幻觉来自协同头里的模态比例漂移,HEAL在推理时把比例拧回去

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

cs.CV, cs.CL, cs.LG

2026-09-06

HEAL用因果噪声和反事实差分把头分成四类,发现幻觉时协同头视觉比例从0.43掉到0.28;只校准协同头后,LLaVA-1.5的POPE F1从85.4升到87.7。

这篇在解决什么

多模态大模型会把图里没有的物体说得像真的。现有推理期办法两条路:改解码(VCD、OPERA),或按注意力权重去加强「视觉头」。权重是间接信号,头与头之间还有协同,单模态加强还会陷入视觉加太猛回复变短、语言加太猛幻觉更多的摆动。

这篇要问的是更细的问题:幻觉发生时,头内部的视觉/语言信息比例到底怎么变。

方法

HEAL 分三步。

关键观察:生成幻觉 token 时,视觉头、语言头的数量和强度没有明显短缺;变的是协同头内部的视觉–语言比例偏离均衡。头角色还会随生成阶段切换:写语言 token 时协同头偏向语言头,写视觉接地 token 时部分语言头变成协同头。

结果

以 LLaVA-1.5-7B 为底,高斯遮罩下协同头的视觉:语言比例,正确 token 约 0.43:0.54,幻觉 token 约 0.28:0.62。

方法POPE F1CHAIRS ↓MME Total
Beam Search85.451.0565.34
EAH85.736.4603.99
MemVR87.146.6648.30
LocoRE86.938.4656.66
HEAL87.736.7669.76

CHAIRS 略逊 EAH(36.7 对 36.4),召回和生成长度更高,MME 全面更高。插到其他模型同样降幻觉:LLaVA-NeXT-7B 的 CHAIRS 从 29.9 到 24.6;Qwen2.5-VL-7B 从 27.2 到 23.3;InternVL-7B 从 46.6 到 39.2。Qwen3-VL-8B 在 MMHal-Bench 幻觉率从 17.5 到 16.6。LLaVA-Bench 上 LLaVA-1.5 从 72.5 到 75.2。

双向干预:把正确回复的视觉比例人为压低,能造出幻觉;把幻觉回复的视觉比例拉高,能减轻幻觉。α 太大语言被压掉,会出现语病,曲线呈 U 形。掩码换成零值、均匀噪声或跨样本对调,头分类一致率 92.13%–95.36%,漂移方向不变。

代价:LLaVA-1.5-7B 上 5.02 token/s(底模 17.25,EAH 3.17),墙钟 70.74 秒对底模 11.36 秒,显存只多 0.26 GB。LLaVA / InternVL 简单基准 α=0.5、难基准 0.6;Qwen 系再低一档。

为什么重要

这是把「幻觉等于视觉注意力不够」改写成「幻觉等于协同头比例漂了」的一篇机制论文,并且给了一个不用训练的补丁。想压物体幻觉、又不想重训 LLaVA / Qwen-VL / InternVL 的人可以直接插。α 要按模型和任务选:粗粒度存在性用小一点,空间推理用大一点。

它治不了编码器阶段就丢了的视觉证据。那是训练和架构的问题,拧注意力头补不回来。

局限与存疑

α 和更新间隔全是经验值,没有闭式规则,换模型要扫一遍。全局同一个 α 打在所有协同头上,论文自己也承认各头偏好并不均匀。吞吐大约降到原来的三分之一(17.25 降到 5.02 token/s),长描述场景不便宜。CHAIRS 没有超过 EAH,所谓均衡优于单模态加强,在物体幻觉指标上只是打平。MMHal 上 Qwen3-VL 只从 17.5 降到 16.6,绝对幅度不大。分类阈值会改头的归属比例,漂移方向稳定,「协同头」这个集合本身仍是阈值的函数。

术语

原文与代码

相关论文

全部论文解读