AgentVLN:3B 模型给机器人当「大脑」,边缘端跑通视觉语言导航

机器之心 · wechat · 2026-09-10

AgentVLN 提出「VLM-as-Brain」架构:视觉语言模型负责理解任务、分析环境和调度技能,建图、避障、移动等执行交给模块化技能库,已被 ECCV 2026 录用。

核心创新是把三维路径规划转换为视觉提示下的选择题——SLAM 计算的三维路径点被投影到摄像头二维图像中,让 VLM 直接在图像上选路径点,回避其不擅长的三维几何推理;同时引入上下文自我纠错与 QD-PCoT「主动提问—调用感知补信息」机制,缓解遮挡与深度歧义。

系统仅用 Qwen2.5-VL-3B 底座,支持 Jetson 等边缘设备实时运行,在 R2R-CE、RxR-CE 等 VLN 基准上取得领先成绩,并已部署到四足机器狗和人形机器人平台。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →