字节跳动 Douyin 多模态 embedding 模型拿到 MMEB-v2 SOTA
_reachsumit · x · 2026-08-04
字节跳动的 Douyin 多模态 embedding 模型拿到 MMEB-v2 SOTA
这份技术报告介绍了一个面向大规模搜索与推荐的多模态 embedding 系统,目标是在 亿级索引效率 和 细粒度匹配能力 之间同时取得平衡。作者特别提到,Douyin、小红书、YouTube 这类平台都需要这种能力。
设计思路
- 传统对比学习模型效率高,但监督信号偏粗,难以处理细粒度差异。
- 基于 CoT 的 embedding 方法判别力更强,但在线服务成本太高。
- 因此作者采用两阶段训练:
- Stage 1:大规模对比式预训练,建立统一的多模态向量空间。
- Stage 2:通过两种只在训练阶段使用的机制补足语义充分性:
- Evidence-Grounded Typed Latent Reasoning
- Cross-Conditional Reconstruction
结果
- 报告称该模型在 MMEB-v2 上达到 SOTA。
- 由于“推理”部分只在训练时使用,查询侧新增延迟很小。
「多模态」频道最新
- MiniMax高管回顾海螺AI成长史,宣布将推进开源 — VoidAsuka · 2026-08-04
- 用 Hailuo AI 制作海报动画:提示词与实测效果 — LudovicCreator · 2026-08-04
- 实测 Qwen3.8-Max:用 Three.js 生成高保真布加迪引擎 — cedric_chee · 2026-08-04
- RTX 3060 12G 实测:17 分钟本地生成 10 秒竖屏视频 — merica420_69 · 2026-08-04
- 告别乱连线:ComfyUI 节点输出可视化调试工具发布 — niknah · 2026-08-04
- 一支 Prompted 科幻恐怖短片主打黑暗诡异氛围 — MovitoirStudios · 2026-08-04