浙大 SuperNav:免微调 MLLM 加导航工具,任意场景执行任意任务
zju3dv · hf · 2026-10-09
浙大 zju3dv 团队发布 SuperNav,一个面向通用服务机器人的智能体导航系统。
核心思路是不对多模态大模型做导航专用微调,而是让 MLLM 专注理解请求、理解场景和决策,把运动执行交给专门的导航工具:
- 提供面向智能体的 Navigation Skills 工具集与任务进度、上下文管理
- 统一的视觉点接口让模型直接在图像中指定目的地,并从执行反馈中修正决策
- 在实例级、多目标、需求驱动任务上超越四个基线;在 HM3D 类别级评测和真实四足机器人部署上验证了跨环境适用性
项目页:zju3dv.github.io/SuperNav
「具身」频道最新
- KAIST 提出 ME-World:多智能体第一人称世界模型联合去噪生成 — kaist-ai · 2026-10-09
- Scoble 亲测 Tesla Cybercab:超出预期,还想买来出租 — Scobleizer · 2026-10-09
- 研究员称自我中心数据采集正当红,当年项目超前时代 — gragtah · 2026-10-09
- DreamTrue世界模型:反事实后训练把交互缺陷率从48%降到6% — Junyan Li · 2026-10-09
- NVIDIA USDCraft:用LLM写程序重建可操作的铰接3D资产 — nvidia · 2026-10-09
- SimpleICL:低成本数据采集实现机器人上下文视觉学习,将全面开源 — Minxing Li · 2026-10-09