MoCA 论文提出分离视觉语言模型的感知与推理

Wenhu Chen 的 spotlight 论文 MoCA 提出在训练过程中将视觉语言模型(VLM)的感知和推理分开处理。这种解耦方法训练出的 7B 模型在感知和推理相关基准测试上均获显著提升,并在部分测试中超越更大规模模型。研究指出,VLM 回答错误时存在“看不见”与“想不明白”两种不同模式,需对应不同修复方案。

2026-07-09 ~ 2026-07-09 · 2 条相关