Qwen 发布 Qwen-Drive-1.0:VLM 架构统一 3D 感知与运动规划
tarantulae · x · 2026-09-02
Qwen 团队在 arXiv 发布 Qwen-Drive-1.0 论文,迈向自动驾驶视觉-语言基础模型。要点:- 保留预训练 VLM 架构,在统一框架内整合 3D 感知、视觉问答与运动规划;- 外挂 BEV 感知头同时完成 3D 目标检测、语义占用预测与 BEV 地图分割,为 3D 场景结构提供可检视接口;- Planning Expert 基于共享 VLM 表征生成自车未来轨迹;- 分阶段训练方案结合驾驶监督数据与通用视觉-语言数据,在获得驾驶能力的同时保留通用理解与指令跟随。开放环、伪闭环与闭环评测均显示具竞争力的运动规划表现。
所属事件:阿里发布 Qwen-Drive-1.0:统一感知与规划的驾驶基座(4 条相关)→
「具身」频道最新
- 反偷拍应用 ZuckOff 走红:靠蓝牙指纹识别身边 Meta 智能眼镜 — LexiLove · 2026-09-21
- CVPR 2026 论文 GaME:让机器人 3D 地图学会遗忘过时几何 — lucacarlone1 · 2026-09-21
- 斯坦福新法解决 VLA 推理延迟:10 分钟数据把成功率从 42% 提到 97% — burny_tech · 2026-09-21
- 160 公斤硬拉实拍:LUDUS 展示惊人力量演示 — AIFlow_ML · 2026-09-21
- DeformSmith:物理引导分层生成可变形资产,服务机器人操作 — Can Li · 2026-09-21
- 累计落地超万台机器人,酷哇科技拆解端侧世界模型 COOWAM 架构 — 创业邦 · 2026-09-21