DINOv2 与 Qwen3 零图文配对实现嵌入空间对齐
TU Munich、MIT、ETH Zurich 等机构 Dominik Schnaus、Phillip Isola 等人的新论文《Shared Geometry as a Rosetta Stone》显示,从未见过 caption 的纯视觉模型 DINOv2 与从未见过图像的纯语言模型 Qwen3,学到的世界结构惊人接近。研究者在完全不使用任何图像-文本配对数据的情况下,成功对齐了两个模型的嵌入空间,实现了零样本对齐,即使图像与文本来自不同来源也有效,弥合了语言表征与感知信号之间的语义鸿沟。
2026-10-10 ~ 2026-10-10 · 4 条相关
- 不用一对图文对:DINOv2 与 Qwen3 嵌入空间零样本对齐成功 — TimDarcet · 2026-10-10
- 零图文配对也能对齐:DINOv2 与 Qwen3 嵌入空间被成功桥接 — NandoDF · 2026-10-10
- DINOv2 与 Qwen3 零配对对齐:图像与语言模型的世界表示惊人接近 — lmoroney · 2026-10-10
- 新论文:纯视觉 DINOv2 与纯文本 Qwen3 涌现出惊人相似的世界几何结构 — lmoroney · 2026-10-10