Douyin Multimodal Embedding Model Technical Report
Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou
cs.IR, cs.CL, cs.CV
2026-08-03
抖音 DME 把推理塞进少量隐 token、把重建留在训练期,多模态检索 2B/9B 在 MMEB-v2 拿 74.8/78.4,查询延迟仅增不到 1 毫秒。
多模态检索要同时满足两个互相打架的要求:一要能在十亿级索引下高效服务,二要对难匹配的 query 做细粒度语义区分。抖音、小红书、YouTube 这类平台两边都苛刻。现有多条技术路线各占一头:对比学习的嵌入模型(如 CLIP、VLM2Vec)高效、能离线编码、和工业向量检索系统对得上,但监督只在「这一对应该近、那一对应该远」的成对层面,粒度太粗;CoT 类模型靠先生成一段推理再出嵌入,细粒度上去了,在线生成本身却太慢,没法当主检索编码器用。
抖音搜索多模态团队(联合人民大学高瓴人工智能学院)的报告要解决的就是这个两难:能不能把细粒度推理塞进一个标准 bi-encoder,既拿到 CoT 那一档的区分力,又不付出在线生成的延迟。
DME 是两阶段训练,骨干用 Qwen3.5,出 2B 和 9B 两个规模。
第一阶段是大尺度对比预训练,2500 万对 query-document,覆盖文本、图像、视频、视觉文档和混合模态,只用一个 <emb> 读出 token 建立统一嵌入空间。监督仍停留在成对层面,目标是给后面打地基。
第二阶段是「语义充分性(semantic sufficiency)」学习,500 万条更高质量的样本,加教师模型(Seed-2.0-Pro)生成的结构化 CoT 监督。论文用「语义充分性」指一个比成对对齐更强的要求:嵌入不仅要和相关的样本近,还要扎根在检索相关的证据上,并保留对面那一侧(被匹配的 query 或文档)的细粒度语义。靠两个机制补足:
两个机制一个管「嵌入怎么形成」(看对证据、按角色组织),一个管「嵌入必须保留什么」(必须能重建出对面)。联合目标把对比损失、两个子目标加在一起。
公开基准 MMEB-v2 上,DME-2B 综合 74.8、DME-9B 综合 78.4,在同等规模里都是 SOTA。分模态看(2B/9B):图像 75.9/79.8、视频 65.6/70.8、视觉文档 79.9/82.0。视频和视觉文档的提升尤其大,DME-9B 视频 70.8,对比 Qwen3-VL-Embedding-8B 的 67.1、TTE-v2-7B 的 60.7。
| 模型 | 规模 | MMEB-v2 综合 |
| VLM2Vec-V2 | 2B | 59.2 |
| Qwen3-VL-Embedding | 2B | 73.2 |
| DME | 2B | 74.8 |
| Qwen3-VL-Embedding | 8B | 77.8 |
| TTE-v2 | 7B | 75.7 |
| DME | 9B | 78.4 |
消融把训练配方逐项打开:直接在第二阶段数据上对比训练(无第一阶段预训练、无两个机制)是 70.9;加第一阶段大尺度预训练到 72.5;再加隐推理到 73.8;再加交叉重建到 74.8。第一阶段预训练的红利集中在视频(55.3→59.3)和视觉文档;隐推理对视频的单项贡献最大(59.3→63.7)。
论文还提了一个挺新的量化:表示完整度(representation completeness)。把一个嵌入当唯一的前缀条件,让模型在 teacher forcing 下还原原文 token。自方向(还原自己的输入)Top-1 命中 87.9%(q2q)/74.3%(d2d),交叉方向(从一侧还原对面)d2q 87.7%、q2d 65.9%。换句话说,一个向量确实装回了大部分原文 token,而不只是个粗检索摘要。
工业落地:在抖音内部离线评测集上整体相对涨 2.92%(四个跨模态方向 +2.70% 到 +3.10%),线上 A/B 测试在抖音搜索拿到 0.1% 的 Lifetime(LT)指标增益。延迟上,隐 token 给文本和视频查询各加不到 1 毫秒(批大小 4 下每 query 约 0.8 毫秒),图文查询几乎可忽略。
这篇给「想要 CoT 级细粒度又付不起 CoT 延迟」的工业检索团队一条可复制的路:把推理压进少量隐 token、把重建监督留在训练期,推理时还是标准向量检索。对做 RAG、多模态搜索、agent 检索工具的人,这意味着不用为了细粒度匹配上重排序或在线生成。表示完整度这个指标本身也好用,它把「嵌入够不够用」从一个直觉问题变成了可量化的诊断信号。
作者没单设局限小节,只在未来工作里提了数据和模型规模两个扩展方向。读下来几个点要打折扣。第一,0.1% LT 是线上真实增益但幅度很小,2.92% 离线涨幅在生产里算稳健不算惊艳,这篇更接近工程整合而非原理突破。第二,9B 上 78.4 对 Qwen3-VL-Embedding-8B 的 77.8 只领先 0.6,而 TTE-v2 用的是 76 任务设定(剔了两个视觉文档 OOD 集),横向比较并不干净。第三,表示完整度是 teacher forcing 下测的,可能高估了真实可还原性,而且视频的交叉 q2d 只有 59.2%,从文本 query 还原视频内容本身就有信息瓶颈。第四,没有放出权重或模型卡,是纯技术报告,可复现性受限。