SSAD 研讨会详解驾驶 VLA 模型构建方法

在 SSAD 2026 研讨会上,讲者回顾自动驾驶技术栈的历史与走向,并提出构建驾驶视觉-语言-动作(VLA)模型的四步流程:模型选型、数据策展、动作头设计与多阶段微调。其展示的 FIVE-VLA 仅 640M 参数即表现出色,通过高分辨率图像输入、极小的视觉编码器加记忆机制等工程设计,效率达到 SimLingo 的 7.5 倍。

2026-09-17 ~ 2026-09-17 · 3 条相关