MIT 团队实现图文免配对对齐:DINOv2 与 Qwen3 嵌入空间直接互通
phillip_isola · x · 2026-10-10
Phillip Isola 团队(Dominik Schnaus 等,TUM/MIT/ETH)实现多年梦想的结果:图像与文本之间无需任何图文配对数据即可对齐嵌入空间。DINOv2 从未见过 caption,Qwen3 从未见过图像,仅凭各自嵌入空间的几何结构("共享几何作为罗塞塔石碑")就能互相对齐,甚至图文来自不同数据集也有效。方法结合 Gromov-Wasserstein 匹配、正交 Procrustes 对齐等技术,在 COCO 验证集 40,504 对上用 FOSCTTM 评测。这暗示各模态的表示几何天然趋同。
所属事件:MIT 团队实现图文嵌入免配对对齐(2 条相关)→
「研究」频道最新
- Calico 开源 Cerberus 基因组模型:786kb 输入预测 8000+ 轨迹,迁移 PyTorch — anshulkundaje · 2026-10-10
- 状态空间模型用于长序列基因组预测,开源 Cerberus PyTorch 模型集 — anshulkundaje · 2026-10-10
- MaCVi 海事计算机视觉工作坊登录 WACV 2027,10 月截稿 — HildeKuehne · 2026-10-10
- OpenAI 将 722 篇数学手稿推上 GitHub,外界模型无法使用 — thursdai_pod · 2026-10-10
- 神经科学论文:AI 模型推导出此前被认为解析不可解的方案 — scottleibrand · 2026-10-10
- 研究实证 text-to-LoRA 可行:从单条输入预测 LoRA 分布做推理扩展 — akyurekekin · 2026-10-10