Qwen 发布 Qwen-Drive-1.0:VLM 架构统一 3D 感知与运动规划

tarantulae · x · 2026-09-02

Qwen 团队在 arXiv 发布 Qwen-Drive-1.0 论文,迈向自动驾驶视觉-语言基础模型。要点:- 保留预训练 VLM 架构,在统一框架内整合 3D 感知、视觉问答与运动规划;- 外挂 BEV 感知头同时完成 3D 目标检测、语义占用预测与 BEV 地图分割,为 3D 场景结构提供可检视接口;- Planning Expert 基于共享 VLM 表征生成自车未来轨迹;- 分阶段训练方案结合驾驶监督数据与通用视觉-语言数据,在获得驾驶能力的同时保留通用理解与指令跟随。开放环、伪闭环与闭环评测均显示具竞争力的运动规划表现。

所属事件:阿里发布 Qwen-Drive-1.0:统一感知与规划的驾驶基座(4 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →