Apple proposes HeadsUp for large-scale 3D Gaussian head reconstruction using 10k+ subject dataset

rsasaki0109 · x · 2026-08-16

Apple proposes HeadsUp, a scalable feed-forward method for reconstructing high-quality 3D Gaussian heads from multi-camera setups.

It uses an encoder-decoder architecture to compress views into a latent representation, decoded into UV-parameterized 3D Gaussians anchored to a neutral template. This decouples Gaussian count from input resolution, enabling training with many high-res views.

Trained on an internal dataset of over 10,000 subjects—an order of magnitude larger than existing datasets—it achieves state-of-the-art reconstruction performance.

Original post →

More from Multimodal

Multimodal channel →