DINOv2 and Qwen3 embedding spaces aligned with zero image-caption pairs

TimDarcet · x · 2026-10-10

Dominik Schnaus demonstrates aligning DINOv2 and Qwen3 embedding spaces without a single image-caption pair — DINOv2 has never seen captions and Qwen3 never images — and it works even when images and captions come from different datasets. Project page and code available.

Related event: DINOv2 and Qwen3 embeddings aligned without any image-text pairs(4 posts)→

Original post →

More from Research

Research channel →