DINOv2 与 Qwen3 零配对对齐:图像与语言模型的世界表示惊人接近
lmoroney · x · 2026-10-10
TU Munich、MIT 等机构 Dominik Schnaus 等人的新论文表明,纯视觉模型与纯语言模型学到的世界结构出乎意料地接近。
- 用只见过图像的 DINOv2 和只见过文本的 Qwen3,以 MS COCO 一半的图像与另一半的 caption 做训练,完全不使用配对数据;
- 方法只学一个正交映射矩阵(仅允许旋转和反射),把图像嵌入旋转到 caption 空间,每张图就落在描述同类内容的 caption 附近;
- 图像与 caption 来自不同数据集时依然成立;对齐质量较粗糙、依赖模型组合,用小配对样本算 CKA 相似度即可预测效果。
作者还提供了可交互项目页,适合做嵌入教学的课堂演示。
所属事件:DINOv2 与 Qwen3 零图文配对实现嵌入空间对齐(4 条相关)→
「研究」频道最新
- NeurIPS 论文「Phantom Transfer」:数据投毒可穿透全部 11 种数据级防御 — OwainEvans_UK · 2026-10-10
- OpenAI 公开数百道未解数学题证明,ChatGPT 智体能向普通人讲明白 — DeryaTR_ · 2026-10-10
- Gym-Anything 获 COLM2026 Lifelong Agents 研讨会最佳论文 — dan_fried · 2026-10-10
- Ai2 发布 Olmo Hybrid:混合架构省 49% 训练 token 达同精度 — allen_ai · 2026-10-10
- 10月22日旧金山 AI for Science 活动:Agent 能否端到端跑科研 — nlarusstone · 2026-10-10
- 论文提出嵌套并行冯诺依曼架构:百万处理器仍是单一计算机 — bronzeagepapi · 2026-10-10