Vision-OPD 用 6.2K 合成样本提升细粒度视觉理解
小红书技术REDtech · wechat · 2026-07-28
小红书 dots 团队提出了 Vision-OPD,一个面向细粒度视觉理解的后训练方法,目标是缩小多模态模型常见的「区域到全局鸿沟」。
文章指出,很多模型在看完整大图时容易被全局场景带偏,但把关键区域裁剪放大后就能答对。Vision-OPD 把这种“看局部更强”的优势转化成训练信号:同一个模型分别扮演裁剪图教师和全图学生,在学生自己采样出来的轨迹上做 token 级在线自蒸馏,让模型学会直接从整图里抓住细粒度证据,而不必依赖推理时反复裁剪、放大或调用工具。
实验结果:
- 仅用约 6.2K 条全自动合成数据。
- 9B 模型在细粒度视觉基准上平均分达到 79.7,总体第一。
- 4B 版本也达到 77.1,超过了更大的闭源和开源模型。
- 在普通视觉任务上表现保持稳定,说明方法提升细节能力的同时没有明显牺牲通用看图能力。
「多模态」频道最新
- AI 重构《奥德赛》135 分钟长片 — heypearlai · 2026-07-28
- Row-Bot 演示把杂乱发布笔记变成海报、文案和设计资产 — Acceptable-Object390 · 2026-07-28
- Nvidia 将开放版视觉语言动作模型放到 Hugging Face — theteknosaur · 2026-07-28
- 有人让 Grok 把 Hodor 变成 Shrek,梗图味拉满 — heypearlai · 2026-07-28
- Fateward 展示了一个用 AI 视频做出的电影感 RPG — Kamacit · 2026-07-28
- Grok 把夜王改成艾莎风格,成了跨界梗图 — eyishazyer · 2026-07-28