EPFL paper recasts multi-view stereo as seq2seq, beating MVS and feed-forward baselines

CSProfKGD · x · 2026-10-03

A NeurIPS paper from Pascal Fua's group at EPFL shows feed-forward models distort geometry even with ground-truth camera poses. The authors reformulate multi-view stereo as a sequence-to-sequence task: a camera-aware transformer injects camera parameters via ray-map embeddings and uses a unified global cost volume to jointly predict geometry for all views. It achieves SOTA on public benchmarks, surpassing both MVS and FF reconstruction baselines.

Original post →

More from Research

Research channel →