阿里发布 Qwen-Drive-1.0-4B:4B 视觉语言模型瞄准自动驾驶场景理解
solyarisoftware · x · 2026-09-06
Hugging Face 上出现了 Qwen-Drive-1.0-4B,一个面向自动驾驶的紧凑型图像-文本-文本模型。它将视觉与语言能力融合,不仅能识别路面画面,还可理解场景、规划行驶动作并回答关于驾驶环境的问题。
该模型体积仅 4B 参数,主打在资源受限的车载场景中运行,是 Qwen 系列向自动驾驶领域延伸的新尝试。
「具身」频道最新
- 宇树机器人现身柏林街头演示,引路人围观 — melnykowycz · 2026-09-06
- 小米人形机器人进厂实训:66 自由度,插螺纹件成功率 98% — Olivier__OG · 2026-09-06
- 机器人版 GPT-3 时刻:看一遍演示就能学会新任务 — 量子位 · 2026-09-06
- ETH Zurich 开源 2026 机器人学习课:12 周覆盖 VLA 与基础模型 — Syntetisaattori · 2026-09-06
- Yacine 自制眼动追踪硬件:自写驱动提速,双摄像头横竖交叉锁定光点 — yacineMTB · 2026-09-06
- StarVLA 开源 VLAct:16 张 GPU 训出 VLA 底座,20% 数据超 NVIDIA GR00T N1.6 — 机器之心 · 2026-09-06