FIVE-VLA 用 640M 参数跑驾驶任务,效率达 SimLingo 7.5 倍
abursuc · x · 2026-09-17
作者在 #ssad2026 演讲中展示 FIVE-VLA:一个总参数量仅 640M 的视觉-语言-动作模型,在驾驶任务上表现出色。
其效率来自几项工程设计:高分辨率图像输入、极小的视觉编码器与 LLM、记忆编码/解码器,以及更少的 token 数——最终在 T4 上比 SimLingo 高效 7.5 倍。说明驾驶场景的 VLA 未必需要大模型,架构取舍更关键。
所属事件:SSAD 研讨会详解驾驶 VLA 模型构建方法(3 条相关)→
「具身」频道最新
- GPT-Policy:让 VLM 靠上下文学习直接驱动机器人,无需梯度更新 — Dongzhou Cheng · 2026-09-17
- 李飞飞 Atlas 扫描靠生成补全,NeRF 发明人坦言产品化是根本挑战 — cen6wkf · 2026-09-17
- 长鑫 LPDDR5X 首进旗舰机,努比亚豆包 AI 手机 5999 元起售 — pstAsiatech · 2026-09-17
- VLA 模型面临语言用量、评测、部署与因果推理等多重挑战 — abursuc · 2026-09-17
- LADA:用潜动作标注低成本模仿语言功能,拆难题为两步 — abursuc · 2026-09-17
- #ssad2026 演讲附赠 Latent Action Models 入门讲解 — abursuc · 2026-09-17