TDDN 融合 DINOv3 与 CleanDIFT,密集预测精度超 CLIP 三倍
udmrzn · x · 2026-09-11
arXiv 论文(2609.07937):现有基于 CLIP-ViT 的 VLM 在换取高层语义时丢失细粒度视觉感知,导致拼图等结构化视觉推理能力不足。作者提出 DiffusedDINO 感知编码器,融合 DINOv3 的全局语义与 CleanDIFT 的细粒度空间特征,并用 RoBERTa-L 对齐得到 TDDN。
主要结果:仅用约 59 万对齐样本、骨干冻结的条件下——
- 图文检索追平 CLIP,四项设置中三项超过;
- 密集预测精度超 CLIP 三倍以上(ADE20K 5.20→18.11 mIoU,COCO-Stuff 7.35→24.44);
- 在通用对比编码器(含 SigLIP 2)中分割基准领先;
- 新发布 Puzzle Perception 分割+VQA 数据集上,TDDN 分割精度翻倍(11.04→22.51 mIoU)。
「多模态」频道最新
- 153 个 GPT Astra 提示词合集:3D 与游戏案例可一键直出 — TheMoonMidas · 2026-09-11
- DeepSeek V4.1 Flash 多模态:45T 图文 token 预训练加模态级负载均衡 — nrehiew_ · 2026-09-11
- Hailuo 768p 视频本地放大到 2K/4K 仍无好方案? — Infinite-Emptiness · 2026-09-11
- 实测 Astra 能 composing SNES 芯片音乐,vibe coding 游戏又添一员 — AIandDesign · 2026-09-11
- H3 Max 视频端点预告:真假画面边界难辨 — noahsolomon · 2026-09-11
- 14 年剪辑师实测:GPT-6 Astra 独自看完 84 段素材并完成剪辑配乐字幕 — TheMoonMidas · 2026-09-11