FIVE-VLA 自动驾驶方案:小视觉编码器加记忆机制,效率较 SimLingo 提升 7.5 倍

abursuc · x · 2026-09-17

作者在 SSAD 2026 演讲中补充了构建驾驶 VLA 模型的更多细节:此前给出四步流程(模型选型、数据策展、动作头设计、多阶段微调),而 FIVE-VLA 通过高分辨率图像输入、极小的视觉编码器与 LLM、记忆编码器/解码器以及更少 token,在 TPU 上效率达到 SimLingo 的 7.5 倍。

所属事件:SSAD 研讨会详解驾驶 VLA 模型构建方法(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →