Where-OPD:用合成场景做空间引导自蒸馏,多模态感知提升 3.23 分

valeocorg · hf · 2026-10-02

论文 Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏新方法。与依赖人工标注 grounding 数据或外部教师模型的现有方案不同,其教师模型获得的是文本形式的空间引导信息,用于指出与问题相关的视觉元素;训练数据采用程序化生成的合成场景,天然自带物体身份与空间坐标,无需人工标注,可规模化进行后训练。

方法要点:

结果: 在 CVBench、V、ZoomBench、BLINK、HR-Bench、MME-RealWorld 六个基准上平均提升 3.23 分,覆盖计数、文档与图表理解等任务,展示了从合成到真实的显著迁移能力。项目页:github.com/sirkosophia/Where-OPD

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →