微信2B多模态向量已超过开源8B,9B在MMEB-v2打到80.6

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu

cs.CV, cs.CL, cs.IR

2026-08-25

微信 WeMM-Embedding 用两阶段把 Qwen3.5 做成 2B/4B/9B 通用多模态向量。2B 在 MMEB-v2 拿到 77.9,超过此前领先的 8B 开源基线;9B 以 80.6 登榜首,并已用于微信推荐和搜索。

这篇在解决什么

检索、推荐、分类和 agent 都需要把文本、图、视频、文档塞进同一向量空间。CLIP 式双塔走不通交错图文、带说明的视频、组合查询。MLLM 可以吃任意交错输入,但要再经过大规模对齐和细粒度相关性学习,才变得好用的 embedding。开源这边 Qwen3-VL-Embedding 和 DME 已经把 2B 推到 MMEB-v2 七十多分,更大的开源 8B 并没有把差距拉开。

方法

三个规格都接在原生多模态的 Qwen3.5 上。输入末尾加 <embedding> token,用最后一层隐状态做 last-token pooling,L2 归一化。同一序列可插多个 embedding 位,例如视频后再接 ASR,一次前向同时出视频-only 和视频+文本向量。Matryoshka 让 64 到全维的前缀都能当合法向量。

数据收成统一的「指令 + 源 + 正目标 + 可选难负例 + 可选分级相关分」。第一阶段用数亿异构对做多任务对齐:弱监督图/视频-文本、描述对、检索对、分类改写成源-标签、多模态 QA,以及人工分级相关。batch 来自同一任务,避免把不同候选空间混成负例;近重复用相似度掩码掉,减少分类这种共享标签任务的假负例。有分级标注时改用按分差加权的 CoSENT 排序损失。

第二阶段数据大约是第一阶段的十分之一:用 Semantic ID(三层残差 k-means)降频热门语义,MLLM 滤错配、修脏 alt-text,再挖难负例。对比损失、分级损失之外,部分任务加上 reranker 分数做组内排序;2B/4B 还从冻结的 9B 蒸馏双向 KL。9B 没有更大老师,就训多个数据配比再 model merging。Reranker 只留在确实涨分的任务上。

结果

MMEB-v2(78 套,图/视频/视觉文档):

模型规模Overall
Qwen3-VL-Embedding2B73.2
DME-Small2B74.8
WeMM-Embedding2B77.9
WeMM-Embedding4B79.2
WeMM-Embedding9B80.6

2B 比同尺寸 Qwen3-VL-Embedding 高 4.7,比 DME-Small 高 3.1,并略高于此前领先的 8B 开源基线。9B 在 2026-08-24 的官方榜上排第一。MMEB-v3 全量(含 11 个音频任务,WeMM 不会音频、计 0 分)2B/4B/9B 为 56.0 / 58.2 / 59.5,文本组和 agent 组也是表内最高。Gemini Embedding 2 报告里那 12 个跨模态检索,2B/4B/9B 平均 79.8 / 80.8 / 81.7。

微信内部 26 任务,2B 平均 72.0,对照开源基线 60.9,五类全胜。线上 14 组 A/B 都正向,已接到视频号、公众号、朋友圈和电商的推荐与搜索。论文没写每组 A/B 的具体提升幅度。

2B 的 MRL:256 维保住 2048 维图像和视频成绩的 98.7%,512 维约 99%。视觉文档对降维更敏感。小规模一阶段消融里,去掉任务一致 batch 从 71.9 掉到 68.5,是最大单项。二阶段从 75.7 累加到 77.9,其中蒸馏 +0.9,扩视觉输入预算再 +0.3。

为什么重要

通用多模态 embedding 已经是推荐和搜索的基础设施。2B 超过旧 8B,意味着很多团队可以在一套 Qwen 骨干上同时服务图、视频、文档和交错查询,不必为每个模态养一个双塔。256 维几乎不掉点,对内存和索引更实在。

这是技术报告,不是受控小论文。可抄的是数据格式、任务一致负例、假负例掩码、以及小模型必须蒸馏。内部 26 任务和 14 组 A/B 证明能上生产,外部无法复核幅度。

局限与存疑

不会音频,MMEB-v3 全量分被这 11 项拖着。数亿训练对的构成、配比和版权边界写得粗。内部榜和线上实验没有可复现协议,也没有报 A/B 的效应量。9B 靠多专家合并,消融分不清是数据还是 merging。榜单截止 2026-08-24。未来工作自己也说要做 omni-modal 和更大尺寸,等于承认当前模态和尺度都还没封顶。

术语

原文与代码

相关论文

全部论文解读