多模态大模型为何无视图片?新研究定位视觉与先验知识冲突瓶颈
Jiaang Li · hf · 2026-08-04
论文探讨多模态大语言模型(MLLMs)在视觉证据与预训练知识冲突时,为何会无视图片而依赖文本先验。
- 诊断与基准:提出两种诊断范式,通过图像重建探测视觉信息,并发布 WhatIfVis 基准(涵盖时空、颜色、数量、尺寸和重量5个维度)来测量模型的多模态上下文敏感性。
- 核心发现:粗粒度视觉证据其实已被完好编码,瓶颈在于后知觉利用阶段。即使明确指示,原始模型对视觉上下文的敏感度也不稳定;而监督微调(SFT)能显著提升这种可控性。
- 控制机制:通过激活修补将权衡定位在特定网络深度,并发现该权衡可沿一个学习向量进行控制,无需意图指令即可改善模型表现。
「研究」频道最新
- Profluent新方法将碱基编辑可靶向突变数提升10倍 — nathanbenaich · 2026-08-04
- 长文反驳“随机鹦鹉”论:称其错误且阻碍 AI 伦理发展 — _FelixSimon_ · 2026-08-04
- MIT 提出多模态临床 AI 模态失效分析框架 — MIT · 2026-08-04
- Eric Horvitz提出决策分析引导,解决大模型高风险决策 — erichorvitz · 2026-08-04
- Nature Medicine 研究:大模型能精准分诊,但存在校准缺陷 — erichorvitz · 2026-08-04
- 面壁智能发双Agent系统,自动化超算加速 — aigclink · 2026-08-04