4B 单目 LightNav-0 在 10 项导航仿真上拿下成功率第一

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan

cs.RO, cs.AI

2026-08-31

LightNav-0 从 Qwen3-VL-4B 引出空间先验,用双通道指向和三枚 RVQ 动作 token 统一指令跟随、物体导航与视觉跟踪,单目 RGB 在 10 项公开仿真上成功率均为第一。

这篇在解决什么

具身导航要同时覆盖指令跟随、找物体、跟踪动态目标,还得换机器人、换场景还能用。现有系统几乎都为单一任务或单一机型堆专用模块:路点预测器、拓扑图、独立动作头。感知、推理、控制被切开,开放词汇迁移差,VLM 已经学到的空间先验也接不进控制。

Qwen3-VL 这类模型本来就会视觉接地、空间推理和指向,但这些能力很少被直接接到机器人动作上。LightNav-0 的主张很明确:不要再为每个任务加预测头,把预训练 VLM 的空间智能引出来,用一套 token 接口覆盖任务和机型。

方法

骨干是原封不动的 Qwen3-VL-4B-Instruct,只扩词表。每一步决策输出固定五枚 token:

双通道指向是显式的空间推理前缀,长度固定,不像自由文本思维链那样拖延迟。格子定义在图像平面,不绑某台机器人的控制空间,所以同一套表示能跨任务、跨机型复用。看不见目标、原地转向或停车,用词表里的保留索引表示。

动作侧三级 codebook,每级 256 个码字。第一枚给出粗轨迹,后两枚修残差;任意非空前缀都能解出可执行轨迹,算力紧时可以只解 1 级或 2 级。三级解码平均位移误差 0.72 cm,对比单级 K=4096 的 VADv2 风格词表的 2.48 cm。

视觉历史按时间远近压缩:近处高采样、细分辨率,远处降采样、粗池化,token 预算封顶。训练分三阶段。先做具身推理中期训练得到 LightNav-ER,再带 DAgger 的监督微调,最后在线 GRPO 强化学习,按任务分别奖励到达、效率、跟踪持续等。语料覆盖 2000 以上场景、4000 小时以上导航数据,SFT 阶段约 77.6% 样本带动作监督,22.4% 复练推理能力。

结果

LightNav-ER 在 8 项具身推理基准的完整集合平均 67.4,超过同尺寸 Qwen3-VL-4B 的 63.1,也超过 8B Molmo2-ER 的 62.8。Where2Place 从 64.0 提到 76.6,RefSpatial 从 45.5 提到 57.4。

导航侧同一份 checkpoint,单目 RGB,无深度、无里程计:

设定LightNav-0最强单目对照
R2R 成功率 / SPL68.5 / 62.8Qwen-RobotNav-4B 66.9 / 60.5
RxR 成功率 / SPL73.6 / 64.5Qwen-RobotNav-8B 73.4 / 63.5
MP3D ObjectNav 成功率53.3CogNav 46.6
HM3D v2 成功率79.5FiLM-Nav 77.0
EVT 分心跟踪成功率82.6ReferTrack 73.3
INSIGHT-Bench 成功率43.7JanusVLN 27.4

去掉指向监督后,R2R 成功率从 68.5 掉到 59.5,HM3D v1 从 74.5 掉到 61.0。从 Qwen3-VL 直接训、不经 ER 中期训练,R2R 成功率 65.8,差 2.7 点。真机零样本覆盖四类机型;跟踪监督里只有人,却能跟人形机器人、轮式机器人和推车。

为什么重要

4B、单目前视、无任务头,已经能在 10 项公开仿真上把单目成功率打到第一。对要上真机的团队,这意味着不必为指令跟随、找物体、跟踪各养一套模型,也不必上全景相机和深度。RVQ 三 token 还让策略梯度能直接吃 log-prob,连续控制不必再套一层 diffusion 或 flow matching。

这是一次把 VLM 空间先验接到控制上的对齐工作,不是新的导航架构发明。

局限与存疑

论文没有单独的局限节,结论里承认了两条。当前是单路径决策,没有把高频局部避障和慢速语义规划拆开;开放世界概念覆盖仍受限于整理过的具身数据,作者建议再补互联网视频预训练。

对照表里全景方法在部分轨迹保真指标上仍领先:RxR 的 nDTW 是 67.4,低于 DualVLN 的 70.0。INSIGHT-Bench 上 Institution 场景成功率只有 29.2,极值类指令 37.2,跨单元分差很大。真机结果是定性演示,没有公开的真机成功率统计。训练不便宜:ER 中期约 170 H100 小时,SFT 约 950 H100 小时。

术语

原文与代码

社区讨论

相关论文

全部论文解读