Uni-LaDiR unifies reasoning across modalities via latent diffusion thoughts

Lianhuiq · x · 2026-10-07

Uni-LaDiR (Unified Latent Diffusion Reasoner) proposes unifying reasoning in a modality-agnostic latent space: humans don't reason separately in pixels vs words, so thinking should live in an abstract latent space. The framework targets both VLMs and VLAs, generates latent thoughts with diffusion, and jointly optimizes the whole system via end-to-end losses from downstream tasks, letting CoT data from images, text and 3D point clouds share one reasoning representation.

Related event: Uni-LaDiR Unifies Multimodal Reasoning via Latent Diffusion(2 posts)→

Original post →

More from Multimodal

Multimodal channel →