DINOv2 与 Qwen3 零图文配对实现嵌入空间对齐

TU Munich、MIT、ETH Zurich 等机构 Dominik Schnaus、Phillip Isola 等人的新论文《Shared Geometry as a Rosetta Stone》显示,从未见过 caption 的纯视觉模型 DINOv2 与从未见过图像的纯语言模型 Qwen3,学到的世界结构惊人接近。研究者在完全不使用任何图像-文本配对数据的情况下,成功对齐了两个模型的嵌入空间,实现了零样本对齐,即使图像与文本来自不同来源也有效,弥合了语言表征与感知信号之间的语义鸿沟。

2026-10-10 ~ 2026-10-10 · 4 条相关