BIT unifies text-to-image and image-to-text in one bidirectional diffusion

burny_tech · x · 2026-09-01

New research introduces BIT (Bidirectional Image-Text Diffusion Bridges), unifying text-to-image and image-to-text generation. Instead of starting from noise, the model transitions directly between text tokens and images within a single bidirectional diffusion process. Paper, demo, and code are available.

Related event: BIT Framework Unifies Text-to-Image and Image-to-Text Generation(2 posts)→

Original post →

More from Multimodal

Multimodal channel →