阿里 UEmbed 把多模态稀疏和稠密检索统一到一模型
Alibaba-NLP · hf · 2026-08-04
- UEmbed 是一个解码器式多模态 embedding 模型,一次前向计算同时输出稀疏词项表示和稠密表示。
- 它通过可学习特殊 token 和词表分片,让每个 token 只预测自己负责子集里的稀疏权重,再把各子集拼成完整稀疏向量。
- 论文公开了 2B、4B、9B 三个规模的模型,全部基于公开数据训练。
- 在 MMEB-v2 上,UEmbed-9B 的 dense 分数达到 71.8、sparse 分数达到 71.0,优于公开数据训练的多模态 embedding 基线;在 BEIR 上也保持竞争力。
- 作者强调它的价值不只在检索效果,也包括效率和 agentic 应用,核心思路是把文本与多模态稀疏检索统一到同一个模型里。
「多模态」频道最新
- ChatGPT 现在能画出指定时间的手表 — binary-baba · 2026-08-04
- 3060 12GB 生成 10 秒皮克斯动画花了 13 分钟 — Pitiful_Archer_4381 · 2026-08-04
- MiniMax H3 新图又好笑又有点翻车 — comfyui_user_999 · 2026-08-04
- 有人在找能提速的 MiniMax 工作流 — PersonalMango2562 · 2026-08-04
- KREA2 加 SCAIL 2 的 V2V 早测只能算一般 — Interesting_Room2820 · 2026-08-04
- MiniMax-H3 在 RTX 4080 上实测:峰值显存 9.45GB — AdOverall2034 · 2026-08-04