SuperNav: ZJU's Agent Harness Lets MLLMs Navigate Any Scene Without Fine-tuning

zju3dv · hf · 2026-10-09

ZJU's zju3dv lab unveiled SuperNav, an agentic navigation system that equips a pretrained MLLM with a navigation harness instead of fine-tuning it. The MLLM handles request interpretation, scene understanding, and decisions, while Navigation Skills tools handle motion execution via a unified visual-point interface. SuperNav beats four baselines on instance-level, multi-object, and demand-driven tasks, with category-level evaluation on HM3D and real quadruped robot deployment.

Original post →

More from Embodied

Embodied channel →