MoCA 论文提出分离视觉语言模型的感知与推理
Wenhu Chen 的 spotlight 论文 MoCA 提出在训练过程中将视觉语言模型(VLM)的感知和推理分开处理。这种解耦方法训练出的 7B 模型在感知和推理相关基准测试上均获显著提升,并在部分测试中超越更大规模模型。研究指出,VLM 回答错误时存在“看不见”与“想不明白”两种不同模式,需对应不同修复方案。
2026-07-09 ~ 2026-07-09 · 2 条相关
- VLM 错误是看不见还是想不明白 — VectorInst · 2026-07-09
- MoCA 分离感知与推理训练 — VectorInst · 2026-07-09