Single RGB Camera Embodied Navigation Model Hits SOTA

sophiamyang · x · 2026-07-08

Achieving SOTA on the R2R-CE validation set (79.4% success in seen scenes, 76.6% in unseen), this model relies solely on a single RGB camera without LiDAR or depth sensors. The 8B model is trained entirely in simulation and runs across wheeled, legged, and aerial robots of varying sizes, while remaining robust to different camera intrinsics.

Related event: Mistral Unveils Robostral, an 8B Embodied Navigation Model(12 posts)→

Original post →

More from Embodied

Embodied channel →