CVPR 2026 口语报告:细粒度负向提问让 MLLM 集体幻觉
zeynepakata · x · 2026-08-22
FINER(Fine-grained NEgative queRies)研究发现,多模态大模型在面对细粒度负向提问(问题中的细节与图片内容有细微出入)时极易产生幻觉,尤其是当不匹配细节与图片中真实存在的元素同时出现时。
主要贡献:
- 发布 FINER-CompreCap 与 FINER-DOCCI 两个基准,覆盖多物体、多属性、多关系与 what 类问题四种设定
- 提出 FINER-Tuning:基于 FINER 风格数据做 DPO 微调
- 对四个前沿 MLLM 微调后,InternVL3.5-14B 幻觉问题最高降低 24.2%,同时在八个既有幻觉评测集上提升,并在六个通用多模态基准上不降反升
代码、基准与模型已开源,论文获 CVPR 2026 oral(award candidate)。
「多模态」频道最新
- AI 电影走出 Demo:四周 200 万美元拍出 110 分钟长片 — lmoroney · 2026-08-22
- Phosphene 4.6.0 重大更新:内置视频编辑器与本地 AI 生成 — Opening-Ad5541 · 2026-08-22
- 用 H3 生成《猫和老鼠》动画,动作快时出现涂抹 — Ok-Giraffe-8670 · 2026-08-22
- NVIDIA 优化 MiniMax H3:单卡 GB200 每月产 37.8 万个视频 — songhan_mit · 2026-08-22
- 新方法 Equilibrium Forcing 实现视频生成的自适应噪声估计 — kwangmoo_yi · 2026-08-22
- GLM-5.2 新增视觉能力,支持图像转代码 — baseten · 2026-08-22