把VLM和导航模型接成长期探索代理,Go2成功率78.3%

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

cs.AI, cs.RO

2026-08-31

NavMCP用意图、观察、记忆三条通道拼接VLM与导航模型,HM-EQA准确率76.7%,对齐条件下比回合式接口高14.9个点,真机Go2上成功率78.3%。

这篇在解决什么

长期物理任务要两件事同时成立:在远处目标上做推理,以及每一步都落到可靠的闭环动作。现在的基础模型把这两件事拆开了。VLM会补全缺失信息、改高层计划,但反复把计划落到导航动作上又脆又慢。导航基础模型(NFM)能把语义目标执行成闭环轨迹,却通常一次只跑一个有界子目标,跨回合不记得已经搜过什么、排除过什么。

把NFM当普通工具调用,会撞上论文说的回合式接口缺口:指令对不上证据需求、中途观察被丢掉、跨调用没有累积。NavMCP要补的就是这层脚手架,两边都不用重训。

方法

上层是VLM代理,主结果用Qwen3.6-Plus;下层执行器是Qwen-RobotNav。协作走三条通道。

Intent把「还缺什么证据」翻成一次语义导航调用,带模式、自然语言子目标、步数预算和约束。两种模式对应NFM常见训练体制:navigatetoobject做目标物搜索,navigatebyinstruction做路线或区域指令。代理不发底层控制。

Observation把一次完整rollout变成带源的旅程证据。沿途采样关键帧,再用VLM摘要成房间、物体、不确定性和未探索出口。每条提及绑到关键帧和置信度,禁止把「这一眼没看见」写成「那里没有」。

Memory跨调用维护紧凑EQA状态,包括交互历史、带源证据账本、未决目标。原始工具返回只在写入账本之后才压缩。回答必须能指回当前观察、旅程摘要、回看的关键帧或笔记。辅助工具有全景检查、开集检测、特写和关键帧回看。

结果

跨论文对照(作者声明只作上下文)里,NavMCP在HM-EQA准确率76.7%,高于FAST-EQA的69.2%;MT-HM3D是54.4%对50.5%;EXPRESS-Bench的LLM Score是79.27对68.7。归一化高层步数是0.15和0.19,低于对照的0.52到0.65。

对齐代理、场景和预算之后,数字更硬。同一套Qwen3.5-397B-A17B下,Explore-EQA 57.6%,ToolEQA 60.8%,FAST-EQA 63.5%,NavMCP加Qwen-RobotNav-8B是74.0%。把三通道换成回合式接口,准确率掉到59.1%,整整14.9个点。拆通道:只返回终点观察少5.9,去掉旅程分析少4.4,去掉跨调用状态少4.6,单一导航模式少2.0。

执行器同样不可互相替代。固定上层,Random Walk 60.9%,Frontier 65.3%,StreamVLN 69.3%,Qwen-RobotNav-4B 73.3%,8B 74.0%。没有代理、只看初始视角只有38.2%。

Unitree Go2上60个episode(每档20个),NavMCP总体成功率78.3%,Frontier 48.3%,反应式NFM 38.3%。单房间领先最强基线10个点,跨房间25个点,超过20米的任务45个点(60%对15%和0%)。计数题最差,65.0%;存在和识别类超过80%。

为什么重要

对做具身代理的人,这篇把「再训一个端到端大模型」换成「把现成的推理模型和导航模型用接口接好」。增益主要来自证据怎么在调用之间留下来,不是来自更大的导航权重。真机上任务越长,脚手架的优势越大,这比再刷一个模拟器分数更有说服力。

代价也清楚:外层仍是大VLM,推理慢;计数会被重复关键帧打虚。

局限与存疑

作者承认两点。依赖大VLM,推理慢;跨视角重复让计数变差。

对照表里跨论文数字不能直接当因果。归一化步数对NFM方法额外按每3米计费,对非NFM基线沿用原文口径,效率对比有偏。真机每档20个episode、人工判成功,区间估计很宽。主结果用Qwen3.6-Plus,消融用Qwen3.5-397B,两套数字不要混着读。没有把脚手架迁到EQA以外的长期操作任务上。

术语

原文与代码

相关论文

全部论文解读