港科广用物体-路径图做开集导航,关系查询成功率0.88

A Topological Representation with Object-Path Graphs for Open-Vocabulary Instance Navigation

Linwei Zheng, Daojie Peng, Bingtao Wang, Haoang Li, Jun Ma

cs.RO

2026-09-21

港科广把开集物体图和可通行路径图做成同一套拓扑:高层用房间-支撑物分层检索,底层用语义视觉伺服走边。关系查询成功率0.88,节点导航成功率0.91。

这篇在解决什么

视觉语言导航现在常见两条路。一条把指令拆成逐步动作,走远了误差累积。一条在线探索、没有环境记忆,重复扫场。场景图能当紧凑语义记忆,但下游导航仍要稠密度量地图或全局定位。图是推理用的,走还是走栅格。

港科广(广州)要把开集语义和拓扑导航接到同一张图上:查询在物体图里落地,路径在可通行图上搜,节点之间用视觉伺服走,不再重建稠密度量场。

方法

先从 RGB-D 建开集物体。SAM 出无类别掩膜,深度反投影成局部点云,用几何重叠和 CLIP 余弦相似度关联到已有物体,点数加权融合特征。多视角裁剪交给 VLM 写描述,LLM 收成一条物体说明。

物体图按房间切。用布局投影和欧氏距离场分房间,LLM 根据房内物体起开集房间名。物体按 3D 包围盒体积分成支撑物(床、桌、柜)和常规小物体。小物体可以连到多个邻近支撑物。相邻物体再送给 LLM 标 on top of / inside / next to 这类关系。房间之间用门口相连。

路径图的节点来自视角变化:两帧可见物体交集比低于阈值就加节点,门口强制插入,空白区域按视角相似度聚类补点。边要求直线可通行。稀疏采样造成的连通分量再插点补上。

导航分三步。短距探索得到全景语义描述子,按环形平移做旋转不变匹配,取余弦最大的路径节点当起点。目标物体用 LLM 抽出物体/支撑物/房间,从房间到支撑物到物体分层检索。Dijkstra 在路径图上出节点序列。节点之间不跟位姿,跟下一节点存好的全景快照做语义视觉伺服:匹配物体的水平夹角残差驱动平面速度,再映射成单轮差速 (v, ω)。误差低于阈值就切下一边。

结果

开集查询 120 条、四场景,含物体、关系、房间+关系。导航 SPL 从 10 个起点测。

方法物体 SR关系 SR房间+关系 SR平均 SR平均 SPL
ConceptGraphs0.580.630.600.60未报
VLMaps0.600.700.750.680.234
HOV-SG0.630.750.850.740.37
本方法0.680.880.930.830.408

关系查询从 HOV-SG 的 0.75 到 0.88,是分层的主要红利。节点检索相对 SceneGraphLoc:四场景 R@1 有的高有的低(0.78/0.72/0.88/0.74 对 0.86/0.80/0.81/0.75),R@5 总体相当。边导航平均 NSR 0.91、路径长度比 1.23。快照里物体少于 8 个且 FOV 90° 时容易偏航,全景更稳。

消融:去掉支撑物层级,NSR 0.77、SPL 0.32;完整加权模型 0.88 / 0.42。真机是 Jetson 车加 ORBBEC Gemini 336L,只展示了边执行,没有量化成功率。

为什么重要

开集家居导航如果还要维护占用栅格和全局定位,部署成本高。这篇把「找哪个实例」和「沿哪些节点走」收到一张轻量图里,控制律是解析视觉伺服,不必再训一套导航策略。关系查询的跳变说明房间-支撑物-物体这三层比纯物体嵌入值钱。

SPL 只比 HOV-SG 高 0.038,导航增益是渐进的。真正省的是稠密地图。

局限与存疑

作者承认节点间伺服不优化全局轨迹平滑,PLR 1.23 就是停顿和折线换来的。动态环境列为未来工作。真机只有定性图。R@1 在两场景低于 SceneGraphLoc,起点偶发找错会把后面的图搜索整段带偏。建图仍用里程计、深度和自由空间碰撞检查,并不是零度量;「摆脱稠密地图」指的是运行期不再做稠密定位和轨迹优化。LLM 标关系和房间名,幻觉边没有单独审计。

术语

原文与代码

社区讨论

相关论文

全部论文解读