DistScene: single-image compositional 3D scene generation with explicit environment modeling

Kunming Luo · hf · 2026-10-07

DistScene generates compositional 3D scenes from a single image. Unlike methods treating scenes as object collections, it models the environment as an explicit scene component providing geometric context for object placement. Three components:

Indoor and outdoor benchmarks show improved scene-level spatial coherence over baselines.

Original post →

More from Multimodal

Multimodal channel →