浙大 PanoVLN:全景视觉语言导航成功率超 SOTA 11.9%,四足机器人实测
ZhejiangUniversity · hf · 2026-09-30
浙江大学提出 PanoVLN,用全景观察替代透视图像做视觉语言导航(VLN)。诊断发现仅换全景图收益有限,需要配套改造:置信度引导执行(CGE)策略动态决定一次执行多少预测动作再重规划,支持更长程规划;构建多分支点、指令清晰的训练路线提供路径选择监督;融合 RGB 全景的语义与几何特征捕捉空间关系而不增加视觉 token。4B 骨干、仅 RGB 输入下,在 R2R-CE 和 RxR-CE Val-Unseen 成功率分别超过此前 SOTA 11.9% 和 8.7%;四足机器人真实场景实验显示导航更快、停顿更少。
「具身」频道最新
- XR 空间 3D 打印 App 更新:激光逐层绘制 Gcode 可远程操控拓竹 — Scobleizer · 2026-09-30
- 车主花 1000 美元装开源套件让特斯拉自动驾驶,引发安全担忧 — science · 2026-09-30
- 物理 AI 创业者社群征集:从灵巧手到机器人基础模型 — Sethwinterroth · 2026-09-30
- EVO-WAM 用自生成视频自验证训练,真实长程任务成功率20%升至76.7% — hitsz123 · 2026-09-30
- WorldLine:万小时视频训练动作驱动模拟器,策略成功率最高提升21.4个百分点 — hongkongust · 2026-09-30
- 德国 Agile Robots 人形机器人每个工作日下线出货,已联手 DeepMind — CyberRobooo · 2026-09-30