AgentVLN:3B 模型给机器人当「大脑」,边缘端跑通视觉语言导航
机器之心 · wechat · 2026-09-10
AgentVLN 提出「VLM-as-Brain」架构:视觉语言模型负责理解任务、分析环境和调度技能,建图、避障、移动等执行交给模块化技能库,已被 ECCV 2026 录用。
核心创新是把三维路径规划转换为视觉提示下的选择题——SLAM 计算的三维路径点被投影到摄像头二维图像中,让 VLM 直接在图像上选路径点,回避其不擅长的三维几何推理;同时引入上下文自我纠错与 QD-PCoT「主动提问—调用感知补信息」机制,缓解遮挡与深度歧义。
系统仅用 Qwen2.5-VL-3B 底座,支持 Jetson 等边缘设备实时运行,在 R2R-CE、RxR-CE 等 VLN 基准上取得领先成绩,并已部署到四足机器狗和人形机器人平台。
「具身」频道最新
- 把 Replit Agent 装进机器人:自主建站并一键发布 — amasad · 2026-09-11
- TARS Robotics 推出具身基础模型 AWE:1 个模型、15+ 任务、零重训练 — heyshrutimishra · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 开发者用 Copilot CLI 加 Astra 调试 ESP32 小硬件 — DanWahlin · 2026-09-11
- 5500 小时真实驾驶数据训出 VATIX 开源驾驶世界模型 — abursuc · 2026-09-11
- 机器人 Reachy Mini 被纳入 NVIDIA 组合后不再低调 — RachelVT42 · 2026-09-11