腾讯发布 WeMM-Embedding 多模态嵌入模型系列
腾讯于 8 月 25 日在 Hugging Face 发布通用多模态嵌入模型家族 WeMM-Embedding,次日发布配套技术报告。该系列基于 Qwen3.5 构建,提供 2B、4B、9B 三种规模,支持文本、图像、视频、视觉文档及任意交错多模态输入,并采用 MRL(Multi-Resolution Representation Learning)技术,返回 4096 维的 L2 归一化嵌入向量。值得注意的是,据 @reachsumit 转述,2B 小模型即超越 8B 基线。
已确认
- 模型家族含 2B、4B、9B 三个版本,基于 Qwen3.5 架构
- 支持文本、图像、视频、视觉文档与交错多模态输入,输出 4096 维 L2 归一化嵌入
- 在 MMEB v2 与 v3 基准上达到 SOTA
- 据 @NielsRogge 对比,该模型在 COCO 图文检索(图像到文本)等任务上表现领先
- 训练分两阶段:大规模多模态对齐阶段与使用精选数据的后续阶段
- 腾讯称该模型在公共基准和大规模微信应用中实现了最先进的检索和推荐性能
- 模型暂不支持音频输入
为什么重要
统一多模态嵌入空间是实现跨模态检索与推荐的关键组件;WeMM-Embedding 将文本、图像、视频、文档映射到共享表示空间并在 MMEB 上登顶,且小规模版本即具竞争力,对检索与推荐应用具有较高实用价值。
2026-08-25 ~ 2026-08-26 · 5 条相关
一手来源
- 腾讯 WeMM-Embedding 多模态嵌入模型技术报告 — tencent ·
- 腾讯发布通用多模态嵌入模型,登顶 MMEB 榜单 — NielsRogge ·
- 腾讯发布 WeMM-Embedding 多模态模型,2B 版超越 8B 基线 — _reachsumit ·
- 腾讯发布 WeMM-Embedding-2B 多模态嵌入模型 — tencent · 2026-08-25
- 腾讯发布 WeMM-Embedding 多模态嵌入模型 — jacek2023 · 2026-08-25
- 【源头】腾讯发布通用多模态嵌入模型,登顶 MMEB 榜单 — NielsRogge · 2026-08-25
另有 2 条近重复转述:tencent · _reachsumit