V-GIFT 用自监督任务提升视觉推理能力

srchvrs · x · 2026-08-26

论文 V-GIFT 提出了一种简单轻量的方法,通过在视觉指令调优中混入少量基于自监督学习(SSL)的任务(如旋转预测、颜色匹配等),迫使模型依赖视觉证据而非语言先验来解决问题。该方法无需修改架构或增加训练阶段,仅需在训练数据中加入 3-10% 的视觉锚定指令,即可在多个基准测试中显著提升多模态模型的视觉推理能力。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →