新论文:纯视觉 DINOv2 与纯文本 Qwen3 涌现出惊人相似的世界几何结构
lmoroney · x · 2026-10-10
TU Munich、MIT、ETH Zurich 等机构 Dominik Schnaus、Phillip Isola 等人的新论文《Shared Geometry as a Rosetta Stone》显示:仅见过图像的 DINOv2 与仅见过文本的 Qwen3,其内部表征空间的几何结构惊人接近。
- 方法:用 MS COCO 一半的图像和另一半的 caption(无配对数据),通过 Gromov-Wasserstein 匹配 + Orthogonal Procrustes 对齐两个嵌入空间,实现跨模态对齐而无需成对训练数据。
- 评测:在 COCO 验证集 40,504 对上用 FOSCTTM(真匹配比其他样本更近的比例,随机为 0.5)度量检索质量;并用 CKA(中心核对齐)分析两个空间样本排列的一致性——CKA 无需共享维度,在正交变换与均匀缩放下不变。
- 结论:视觉与语言模型即便训练模态完全分离,也会收敛到相似的世界结构,佐证「共享几何」可作为跨模态的罗塞塔石碑。
项目页含交互式可视化。
所属事件:DINOv2 与 Qwen3 零图文配对实现嵌入空间对齐(4 条相关)→
「模型」频道最新
- Grok 机器人一次成功 Amazon 下单,购物 agent Muse 两度失败 — jamesperkins · 2026-10-10
- Google AI Pro 订阅捆绑 Colab 权益:80GB A100 可全参微调 Gemma 31B — algo_diver · 2026-10-10
- 比人更聪明的模型,每百万 token 只收 0.1 美元 — dan_s_becker · 2026-10-10
- 马斯克演示 Grok 可为任意主题生成模拟场景 — elonmusk · 2026-10-10
- Burkov断言:仅靠模型本身永远无法解决幻觉问题 — burkov · 2026-10-10
- 4GB 显存 10 分钟微调:Qwen3.5 0.8B 决策模型准确率 37% 升至 65% — danielhanchen · 2026-10-10