MIT 团队实现图文免配对对齐:DINOv2 与 Qwen3 嵌入空间直接互通

phillip_isola · x · 2026-10-10

Phillip Isola 团队(Dominik Schnaus 等,TUM/MIT/ETH)实现多年梦想的结果:图像与文本之间无需任何图文配对数据即可对齐嵌入空间。DINOv2 从未见过 caption,Qwen3 从未见过图像,仅凭各自嵌入空间的几何结构("共享几何作为罗塞塔石碑")就能互相对齐,甚至图文来自不同数据集也有效。方法结合 Gromov-Wasserstein 匹配、正交 Procrustes 对齐等技术,在 COCO 验证集 40,504 对上用 FOSCTTM 评测。这暗示各模态的表示几何天然趋同。

所属事件:MIT 团队实现图文嵌入免配对对齐(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →