浙大 PanoVLN:全景视觉语言导航成功率超 SOTA 11.9%,四足机器人实测

ZhejiangUniversity · hf · 2026-09-30

浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。诊断发现仅换全景图收益有限,需要配套改造:置信度引导执行(CGE)策略动态决定一次执行多少预测动作再重规划,支持更长程规划;构建多分支点、指令清晰的训练路线提供路径选择监督;融合 RGB 全景的语义与几何特征捕捉空间关系而不增加视觉 token。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超过此前 SOTA 11.9% 和 8.7%;四足机器人真实场景实验显示导航更快、停顿更少。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →