腾讯开源 WeMM-Embedding 多模态嵌入模型,登顶 MMEB 榜单
腾讯在 Hugging Face 上开源发布 WeMM-Embedding 系列通用多模态嵌入模型,提供 2B、4B、9B 三个规格,均基于 Qwen3.5 并采用 Apache 2.0 许可。该系列可将文本、图像、视频和视觉文档嵌入同一向量空间,支持跨模态检索,尤其面向视频语料场景的混合媒体检索。
已确认
- 三规格:WeMM-Embedding-2B、4B、9B,基于 Qwen3.5,Apache 2.0 开源
- 多模态文档表示:单个输入可交错包含多张图片或多个视频
- MMEB-v2(78 个数据集)成绩:9B 版 80.6 分居首,超过闭源 DME-Medium(78.4)与 Qwen3-VL-Embedding-8B;2B 版以约四分之一参数量反超 8B 模型
- 视频子集优势最大:WeMM-9B 74.3、WeMM-2B 70.8、Qwen3-VL-Embedding-8B 67.1,2B 版领先 8B 达 3.7 分
- MMEB-v3(覆盖 190 个任务,含文本、agent、跨模态检索等):9B 版 59.5 居榜首,4B 版 58.2,2B 版超过 7B/8B 级模型
为什么重要
- 开源且许可宽松,为跨模态检索、RAG 与视频检索应用提供了可直接落地的统一嵌入方案
- 小尺寸模型在权威基准上反超更大参数量的竞品,说明架构与训练策略的效率优势,降低了部署成本
2026-09-02 ~ 2026-09-02 · 6 条相关
一手来源
- 腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen ·
- MMEB-v2 实测:WeMM-2B 以四分之一体积胜过 Qwen3-VL-Embedding-8B — tomaarsen ·
- WeMM-Embedding 登顶 MMEB-v3:9B 得 59.5 分,2B 超 7B/8B 模型 — tomaarsen ·
- 【源头】腾讯开源 WeMM-Embedding:文本图像视频统一嵌入,Apache 2.0 — tomaarsen · 2026-09-02
- WeMM-Embedding 登顶 MMEB-v2:2B 版以四分之一参数反超 8B 模型 — tomaarsen · 2026-09-02
- 视频检索差距最大:WeMM-2B 在 MMEB-v2 视频子集超 8B 达 3.7 分 — tomaarsen · 2026-09-02
- 腾讯 WeMM 多模态嵌入模型发布,支持图文视频统一检索 — tomaarsen · 2026-09-02
- 【源头】WeMM-Embedding 登顶 MMEB-v3:9B 得 59.5 分,2B 超 7B/8B 模型 — tomaarsen · 2026-09-02
另有 1 条近重复转述:tomaarsen