Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang
cs.RO
2026-08-18
导航动作改成「点像素再投到 3D」,只在关键节点触发 CoT,两级 GRPO 训练;R2R-CE 66.2% 成功率,单卡 16.6 秒一任务,真机零调参 60%。
VLM 直接搬进具身导航会撞三堵墙。动作空间错位:现有方法要么输出「左转 30 度」这类原子动作,要么直接回归 3D 坐标,而 VLM 的预训练先验全在 2D 图文对上,硬学 3D 几何变换导致空间幻觉和低样本效率。推理节奏刚性:每步或固定间隔触发思维链,决策质量上去了,延迟也上去了。长程记忆两头堵:全存视觉特征会让注意力稀释加上下文溢出,乱丢历史又丢掉关键信息,而且没有显式时空坐标组织历史,机器人说不清自己走过哪。
浙大团队的做法是四件事各管一段:
基座 Qwen2.5-VL-7B,先在 90k 轨迹的 MultiNav-CoT 上 SFT 一轮,再跑 800 步 GRPO,合计约 760 GPU 小时。
| 设置 | 指标 | 结果 |
| R2R-CE val-unseen | 成功率 | 66.2%(上代最好 NavFoM 61.7、DualVLN 64.3) |
| RxR-CE val-unseen | 成功率 | 65.7%(DualVLN 56.9) |
| 单任务耗时(单张 A800) | 推理效率 | 16.58s(StreamVLN 37.47s、DualVLN 41.46s) |
| 长程子集(>12.5m) | 成功率 | 49.8%(DualVLN 41.9%、StreamVLN 30.9%) |
| 真机零调参(100 试验) | 成功率 | 60%(StreamVLN 49%、DualVLN 53%) |
消融把每个组件的价值拆开了:把像素动作换回 NavFoM 式度量航点,SR 掉 24.8 点,是全表最大的单项;只用轨迹级优势掉 4.1 点,再去掉退火引导再掉 2.8 点;全量历史换锚点记忆掉 4.3 点,再去掉 STI token 再掉 2.6 点。推理时机是学出来的:RL 后直走廊上的推理占比从 38% 降到 11%,CoT 只花 26.3% 的步数就追平全量推理的 66.8%(差 0.6 点)。深度噪声 σ=0.2 时 SR 只降 2.8 点。
「让 VLM 做它预训练就会的事」这个设计原则被数字撑得很实:一个 7B 模型在两项基准上都压过了更大的专用模型,交互步数从 30 步级压到 9 步,推理时间减半。选择性推理的结论对任何长程 agent 都通用:推理密度本身可以当奖励项训掉,不需要手工定节奏。记忆设计(贵特征只存锚点,轨迹走轻量几何 token)给上下文预算管理提供了一个可复制的模板。代码开源于 ZJU-OmniAI。
训练依赖仿真器的特权信号(进度、成功、SPL、碰撞),论文明说当前不支持真机在线 RL,真机部署是冻结策略零样本迁移。深度依赖是硬伤:像素到 3D 的投影、STI 编码、坐标变换全要深度,受控噪声实验只测到 σ=0.2,大面积深度失效或 SLAM 漂移未评估。STI 只编码平面位置和朝向,没有高度,多楼层建筑里分不清层。推理密度奖励的阈值(0.4/0.6)是按 R2R-CE 的分布定的,换任务分布要重调。CoT 蒸馏用了 Gemini 2.5 Flash,教师质量的敏感度实验显示 Qwen2.5-VL-7B 自产的 CoT 反而低于不写 CoT,学生能吃到的推理质量上限被教师框住。SOTA 声明只对 val-unseen 成立,各对比方法的传感输入与低层控制并不完全对齐,论文在真机一节坦承比的是「各自推荐配置下的完整系统」。