腾讯发布 WeMM-Embedding 多模态嵌入模型系列

腾讯于 8 月 25 日在 Hugging Face 发布通用多模态嵌入模型家族 WeMM-Embedding,次日发布配套技术报告。该系列基于 Qwen3.5 构建,提供 2B、4B、9B 三种规模,支持文本、图像、视频、视觉文档及任意交错多模态输入,并采用 MRL(Multi-Resolution Representation Learning)技术,返回 4096 维的 L2 归一化嵌入向量。值得注意的是,据 @reachsumit 转述,2B 小模型即超越 8B 基线。

已确认

为什么重要

统一多模态嵌入空间是实现跨模态检索与推荐的关键组件;WeMM-Embedding 将文本、图像、视频、文档映射到共享表示空间并在 MMEB 上登顶,且小规模版本即具竞争力,对检索与推荐应用具有较高实用价值。

2026-08-25 ~ 2026-08-26 · 5 条相关

一手来源

另有 2 条近重复转述:tencent · _reachsumit