多模态大模型为何无视图片?新研究定位视觉与先验知识冲突瓶颈

Jiaang Li · hf · 2026-08-04

论文探讨多模态大语言模型(MLLMs)在视觉证据与预训练知识冲突时,为何会无视图片而依赖文本先验。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →