FIVE-VLA 用 640M 参数跑驾驶任务,效率达 SimLingo 7.5 倍

abursuc · x · 2026-09-17

作者在 #ssad2026 演讲中展示 FIVE-VLA:一个总参数量仅 640M 的视觉-语言-动作模型,在驾驶任务上表现出色。

其效率来自几项工程设计:高分辨率图像输入、极小的视觉编码器与 LLM、记忆编码/解码器,以及更少的 token 数——最终在 T4 上比 SimLingo 高效 7.5 倍。说明驾驶场景的 VLA 未必需要大模型,架构取舍更关键。

所属事件:SSAD 研讨会详解驾驶 VLA 模型构建方法(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →