Vision-OPD 用 6.2K 合成样本提升细粒度视觉理解

小红书技术REDtech · wechat · 2026-07-28

小红书 dots 团队提出了 Vision-OPD,一个面向细粒度视觉理解的后训练方法,目标是缩小多模态模型常见的「区域到全局鸿沟」。

文章指出,很多模型在看完整大图时容易被全局场景带偏,但把关键区域裁剪放大后就能答对。Vision-OPD 把这种“看局部更强”的优势转化成训练信号:同一个模型分别扮演裁剪图教师和全图学生,在学生自己采样出来的轨迹上做 token 级在线自蒸馏,让模型学会直接从整图里抓住细粒度证据,而不必依赖推理时反复裁剪、放大或调用工具。

实验结果:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →