Omni-Embed-Mini:0.9B 参数统一嵌入六种模态且文本检索零退化
_reachsumit · x · 2026-10-02
论文提出 Omni-Embed-Mini,一个 0.9B 参数的全模态嵌入模型,可将文本、语音、音频、图像、视频和富文本文档映射到同一余弦空间。
- 核心思路:文本编码器完全冻结(权重 bit 级不变),文本检索不可能退化;用媒体样本配对的密集级联 caption 过冻结 backbone 编码作为教师信号,师生共享同一权重几何,只需轻量投影器加分阶段 LoRA 即可对齐新模态。
- 训练配方:Matryoshka SigLIP 对比损失 + 在线混合难负例挖掘器,负例难度随编码器提升而 sharpen。
- 结果:MTEB-v2 BEIR-8 上文本检索保持 49.57 nDCG@10,比同类开源全模态嵌入器小约 2.7x–9.5x;同配方可扩展到 2.3B 变体(换原生视觉-语言 backbone)。
「多模态」频道最新
- PEARL 发布首个用户历史驱动的个性化图像生成基准,指标平均提升 15% — Bo Ni · 2026-10-02
- 首篇系统综述:视频-音频联合生成与编辑统一形式化,9 类 28 种编辑 — Abhinav Sharma · 2026-10-02
- 用 Codex + Higgsfield MCP 制作 NCT 127 完整 AI MV — leesysysysy · 2026-10-02
- 实测:用 Nano Banana 做图像编辑,效果直接看图 — tkasasagi · 2026-10-02
- 博主实测:Opus 5.5 剪视频很强,但无需求硬用产出多垃圾 — AlchainHust · 2026-10-02
- Reddit 用户用 AI 做出以假乱真的概念车动态视频 — Vashukanni · 2026-10-02