TDDN 融合 DINOv3 与 CleanDIFT,密集预测精度超 CLIP 三倍

udmrzn · x · 2026-09-11

arXiv 论文(2609.07937):现有基于 CLIP-ViT 的 VLM 在换取高层语义时丢失细粒度视觉感知,导致拼图等结构化视觉推理能力不足。作者提出 DiffusedDINO 感知编码器,融合 DINOv3 的全局语义与 CleanDIFT 的细粒度空间特征,并用 RoBERTa-L 对齐得到 TDDN。

主要结果:仅用约 59 万对齐样本、骨干冻结的条件下——

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →