FIVE-VLA 自动驾驶方案:小视觉编码器加记忆机制,效率较 SimLingo 提升 7.5 倍
abursuc · x · 2026-09-17
作者在 SSAD 2026 演讲中补充了构建驾驶 VLA 模型的更多细节:此前给出四步流程(模型选型、数据策展、动作头设计、多阶段微调),而 FIVE-VLA 通过高分辨率图像输入、极小的视觉编码器与 LLM、记忆编码器/解码器以及更少 token,在 TPU 上效率达到 SimLingo 的 7.5 倍。
所属事件:SSAD 研讨会详解驾驶 VLA 模型构建方法(3 条相关)→
「具身」频道最新
- VLA 模型面临语言用量、评测、部署与因果推理等多重挑战 — abursuc · 2026-09-17
- LADA:用潜动作标注低成本模仿语言功能,拆难题为两步 — abursuc · 2026-09-17
- #ssad2026 演讲附赠 Latent Action Models 入门讲解 — abursuc · 2026-09-17
- FIVE-VLA 用 640M 参数跑驾驶任务,效率达 SimLingo 7.5 倍 — abursuc · 2026-09-17
- Real-to-Sim-to-Real:保持功能的形状变形生成零样本机器人操作数据 — zhenjun_zhao · 2026-09-17
- ActiveScale:用 1000 小时自我中心数据训练会主动观察的 VLA 机器人 — zhenjun_zhao · 2026-09-17