Where-OPD:用合成场景做空间引导自蒸馏,多模态感知提升 3.23 分
valeocorg · hf · 2026-10-02
论文 Where-OPD 提出一种面向多模态大模型(MLLM)的在线自蒸馏新方法。与依赖人工标注 grounding 数据或外部教师模型的现有方案不同,其教师模型获得的是文本形式的空间引导信息,用于指出与问题相关的视觉元素;训练数据采用程序化生成的合成场景,天然自带物体身份与空间坐标,无需人工标注,可规模化进行后训练。
方法要点:
- 教师(EMA 版本)利用空间指引定位并整合多个相关图像区域的证据
- 学生模型仅凭图像和问题学会复现这一行为
- 后训练只用合成场景,但提升能迁移到真实世界感知基准
结果: 在 CVBench、V、ZoomBench、BLINK、HR-Bench、MME-RealWorld 六个基准上平均提升 3.23 分,覆盖计数、文档与图表理解等任务,展示了从合成到真实的显著迁移能力。项目页:github.com/sirkosophia/Where-OPD
「多模态」频道最新
- 16GB 显存本地跑通 LTX 2.5 生成完整 MV,效果出乎意料 — sokmech · 2026-10-02
- 全队没人会用 Blender,靠 Claude 跑通整套 3D 电影工作流 — gen_ericai · 2026-10-02
- Meshy 预告 3D 局部编辑:选中区域输入文字即可改 — rms80 · 2026-10-02
- AI 音乐视频制作流水线公开:Midjourney+Suno+three.js 全流程 — ciguleva · 2026-10-02
- 用 Seedance 快速生成西部片场景《受袭的马车队》 — Necessary-Use-3820 · 2026-10-02
- 动画团队回应「prompting 什么都没做」:AI 只是动画电影新工具 — rickasaurus · 2026-10-02