ByteDance’s Douyin multimodal embedding model reaches SOTA on MMEB-v2

_reachsumit · x · 2026-08-04

ByteDance’s Douyin multimodal embedding model uses latent reasoning to hit SOTA on MMEB-v2

The technical report describes a two-stage multimodal embedding system for large-scale search and recommendation.

Why it matters

Training design

Claimed outcome

Original post →

More from Multimodal

Multimodal channel →