阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解

solyarisoftware · x · 2026-09-06

Hugging Face 上出现了 Qwen-Drive-1.0-4B,一个面向自动驾驶的紧凑型图像-文本-文本模型。它将视觉与语言能力融合,不仅能识别路面画面,还可理解场景、规划行驶动作并回答关于驾驶环境的问题。

该模型体积仅 4B 参数,主打在资源受限的车载场景中运行,是 Qwen 系列向自动驾驶领域延伸的新尝试。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →