IROS 2026 最佳论文:3D 特征直入 VLM,导航成功率升至 74.2%
qinzytech · x · 2026-10-09
IROS 2026 最佳论文 SoftNav 将 3D 场景特征直接以「soft tokens」形式喂给视觉语言模型来引导导航,而非先转成文本描述。
- 在 HM3D-OVON seen 集上,同等 3D 编码器与 VLM 条件下,直接特征把导航成功率从 66.7%(文本接口)提升到 74.2%
- 在 unseen 集上出现分化:SoftNav 到达目标更多(66.7% vs 63.3%),但按路径长度加权的成功率反而更低(25.7% vs 28.3%),解出的回合里绕了更长的路
- 更丰富的文本基线在统计上也能追平 SoftNav 的成功率
- 训练仅用 1,187 个样本、约 1700 万可训练参数,基础模型全部冻结
作者向研究者提问:在固定基座的条件下对比过「文本描述 vs 直传特征」吗?差异体现在到达率还是路径效率上?
「具身」频道最新
- Text2Sim 用文本生成物理仿真场景,输出可编辑的真物理视频 — erwincoumans · 2026-10-09
- 新加坡 6 英尺机器人格斗翻车,作者指出是遥操作策略选错 — carlosdponx · 2026-10-09
- PredActor 用单一扩散策略统一人形机器人运动生成与控制,G1 端侧跑 50Hz — carlosdponx · 2026-10-09
- Meta 智能眼镜美网广告走红,评论称手机或可留在口袋 — armand_ruiz · 2026-10-09
- 自动驾驶仿真新法:以风险百分位精确控制角落场景有多「角落」 — Jiaxi Liu · 2026-10-09
- 英特尔高管:企业机器人价值大头在存量装机,而非新销售 — ryanshrout · 2026-10-09