SuperNav: An Agentic Navigation System for Any Task in Any Scene
Jinkai Zhang, Jingyi Xu, Yuanhong Yu, Jiarui Guo, Ruizhen Hu, Hujun Bao, Xiaowei Zhou, Sida Peng
cs.RO, cs.CV
2026-10-08
SuperNav 不微调预训练多模态大模型,让它在前后左右四张图上点选目的地,走路交给几何规划或学习式策略。150 条单目标任务成功率 78.00%,UniNaVid 为 34.00%。
服务机器人的请求经常不是「找一类物体」这么单一。指定某一张沙发、按顺序访问多个物体,或是收拾出一块能干活的地方,要找的东西、探索方式和完成条件都不一样。场景还是没见过的房子。论文要同时处理任务泛化和场景泛化。
模块化零样本导航把视觉语言模型当成打分器,给观察和目标的相关度打分,再送进固定流程。VLFM、ApexNav 都属于这种。分数能随画面变,何时从搜索切到确认、何时停止,仍写在流程里。请求类型一变,流程就得改。端到端方法把模型在导航轨迹上微调,直接预测动作,NaVid、UniNaVid、StreamVLN 是这一路的代表。学到的是训练房子里画面、指令和动作的对应,换布局就不可靠。
SuperNav 不微调 MLLM。决策用 GPT-5.6 Terra(高推理档),经 Codex CLI 调工具,工具经 MCP 接到仿真器或真机。Harness 提供导航工具、按需阅读的 Navigation Skills,以及目标进度和上下文管理。
观察返回前、右、后、左四张 RGB。移动时在某一视图上点一个点,调用 PointNav(视角, [u, v]),u、v 相对左上角,范围 0 到 1。点可以打在物体上,也可以打在可见地面上。返回新图像后再决策。
几何执行器靠深度和位姿反投影,再沿导航网格走。仿真直接提供这些几何。Go2 用激光雷达叠 0.05 米体素图,里程计定位,无回环。学习式执行器只吃 RGB:目标标记固定在参考图上,DINOv2 看当前帧和最多 12 帧历史,用 flow matching 预测 8 段 0.25 米位移,随后重规划。它模仿测地线专家,推理时不要深度。
Skills 是 Markdown 规程,管搜索、复查、脱困和完成判定。模型自己决定读不读。规程不强制动作序列,也不代做语义判断。过时图像删掉像素,保留路径和文字,需要时再取。结束工具只记录模型宣布的达成或受阻。关掉会话不等于任务成功,评测按距离另判。
决策模型固定为 GPT-5.6 Terra。基线是 NaVid、UniNaVid、StreamVLN 和 OmniNav 的 Action Former。实例任务在 Habitat-GS 的 InteriorGS 上,单目标和有序多目标各 150 条。到达要求到认可视点的测地距离小于 1 米,并且显式 STOP。需求驱动用 Demand-Bench 的 200 条 AI2-THOR 任务,改成 1 到 8 个有序阶段,每阶段进入可用物体的 2 米包围盒,物体不复用,同样要 STOP。分数不能和 DemandAgent 原文直接比。
| 方法 | 单目标 SR / SPL | 多目标 SR / SPL | 需求驱动 SR / SPL |
| NaVid | 24.67% / 0.1599 | 2.67% / 0.0216 | 17.00% / 0.0920 |
| UniNaVid | 34.00% / 0.1833 | 1.33% / 0.0131 | 25.00% / 0.0943 |
| StreamVLN | 13.33% / 0.1036 | 0.00% / 0.0000 | 25.50% / 0.0775 |
| OmniNav Action Former | 27.33% / 0.2133 | 4.00% / 0.0275 | 37.50% / 0.1213 |
| SuperNav 几何 | 78.00% / 0.4127 | 34.00% / 0.1388 | 59.50% / 0.1801 |
| SuperNav 学习式 | 68.00% / 0.2059 | 34.00% / 0.0862 | 45.00% / 0.1603 |
几何后端单目标 78.00%,UniNaVid 为 34.00%,SPL 从 0.1833 到 0.4127。学习式后端不用深度和导航网格,成功率 68.00%,SPL 0.2059。多目标两条后端都是 34.00%,几何路径更短,基线里最高的 OmniNav 只有 4.00%。需求驱动上几何后端 59.50%,学习式为 45.00%,OmniNav 为 37.50%。
分段进度不要求 STOP。多目标上几何后端第一目标 85.33%(150 条),第五目标 39.47%(38 条)。需求驱动第一阶段 72.00%,第五阶段 9.09%(11 条)。第六阶段起所有方法都是 0,够格任务只剩 3、2、1 条。
类别导航分开评。HM3D-OVON 抽 120 条 val-unseen,没有专项训练。几何后端 1 米阈值 SR 73.33%、SPL 0.4105,0.25 米 SR 68.33%、SPL 0.3837。学习式后端 1 米 SR 70.83%,SPL 掉到 0.1443。HM3Dv2 的 1000 条上,几何后端 0.2 米 SR 80.30%、SPL 0.3338,1 米 SR 86.50%、SPL 0.3638。
消融锁定几何执行器和同一 120 条。去掉 Skills,0.25 米 SR 从 68.33% 降到 35.00%,1 米从 73.33% 降到 54.17%。只留前视,0.25 米 SR 52.50%、SPL 0.2230。用 LocateAnything 做语言定位再选点,0.25 米 SR 55.83%,不如直接点像素。换成 GPT-6 Astra 中档、harness 不变,0.25 米 SR 71.67%(86/120),SPL 0.4579。Go2 演示包括找篮球,以及打印机后再找垃圾桶,没有成功率。
决策和走路拆开以后,两边都能换。上层不靠导航数据微调,下层几何规划和学习式策略共用图像上的点选。搜索和确认策略写在 Markdown 里,改规程不用重训。
和 NaVid 一系、OmniNav 快系统比,单目标从 34.00% 到 78.00%,需求驱动从 37.50% 到 59.50%,多目标从 4.00% 到 34.00%。学习式后端单目标还有 68.00%,不是只靠仿真导航网格。去掉 Skills 后,0.25 米成功率从 68.33% 降到 35.00%。
多目标总成功率停在 34.00%。已有深度和定位时,这套 harness 可以接上去试。只有 RGB、还要计较路径长度时,学习式执行器的 SPL 目前不够用。
论文写明四件事。语义判断受 MLLM 限制。几何执行依赖地图或场景几何。推理时延波动大,正文没给延迟和费用。需求驱动只测按顺序走到相关物体,不测事情本身做完没有。
对照并不对齐。基线多为前视,OmniNav 另有三视和位姿,SuperNav 是四路方向图。几何后端用了仿真深度和导航网格。学习式后端把单目标从 78.00% 降到 68.00%,SPL 从 0.4127 降到 0.2059。成功率仍高于 UniNaVid,路径效率的优势缩小很多。
公开的类别导航结果协议不齐。OVON 只评 120 条,有 2 条按不可达规则记成功。实例任务要求 STOP,HM3D 这组不要求。0.2 米档 ApexNav 的 SPL 为 0.3800,高于 SuperNav 的 0.3338,SR 则是 76.20% 对 80.30%。
多目标必须按序到达再 STOP,总成功率 34.00%。需求驱动第五阶段之后基本失败。进度来自模型自述。真机没有成功率。Skills 是手写规程,权重不微调。决策模型闭源,单次超时 3600 秒。实例基准自建,标注由生成模型起草,再经人工核对。