VCSD 用图像内容对比实现视觉语言模型自蒸馏

burny_tech · x · 2026-07-27

Visual Contrastive Self-Distillation(VCSD) 提出了一种更简单的视觉语言模型自蒸馏方法:不再依赖外部教师模型,也不需要 privileged answers,而是通过“原图 vs. 去内容控制图”的对比,把图像内容从教师信号里提炼出来。

方法

结果

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →