VLA 模型去掉执行回路里的 LLM,4090 上跑到 32Hz、显存不到 1GB

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

cs.CV, cs.RO

2026-07-30

把视觉语言动作模型的执行回路改成 V+L→A,用 DINOv3 和轻量 BERT 直接出动作;4090 上 32Hz、0.9GB 显存、0.2B 参数,LIBERO 成功率 97.7%,超过 π0.5。

这篇在解决什么

视觉语言动作模型(VLA)控制机械臂,慢和吃显存是通病。主流走 V→L→A:把画面塞进一个大语言模型再解码成动作,要么像 OpenVLA、RT-2 那样逐 token 自回归(慢),要么像 π0、π0.5 那样避开逐 token 生成但仍把所有输入塞进几十亿参数的 LLM 核心(重)。在 4090 上,这些方法延迟从 84 毫秒(π0)到 203 毫秒(SmolVLA)不等,显存动辄十几个 G。机械臂要的是几十毫秒内必须出动作的控制环,这套架构天生不对路。这篇的判断很直接:执行级指令不需要开放式语言生成,LLM 这个中间环节可以拿掉。

方法

TurboVLA 把回路改成 V+L→A,直接去掉 LLM。视觉用 DINOv3(判别式视觉编码器,擅长结构化特征),文本用轻量 BERT,两者用双向交叉注意力(借鉴 Grounding DINO)做任务条件化,不靠大模型搭桥。这里的关键判断是:真机指令大多是「把那个红色方块放到碗里」这种确定性表述,不需要 LLM 的生成和推理能力,BERT 的语义理解就够,省掉的是几十亿参数的推理成本。动作用 ACT 式的非自回归 transformer 解码器,一次前向就吐出一段连续动作块(LIBERO 上 12 步、双臂 50 步),不做 token 化也不逐个生成,这是延迟能压到毫秒级的主因。机器人状态单独编码,只在解码器阶段注入,让视觉和文本的跨模态交互专注在场景理解上。整套只 0.2B 参数。

结果

4090、batch size 1 下,LIBERO 单臂平均成功率 97.7%,延迟 31.2 毫秒(32Hz),显存 0.9GB,参数 0.2B。对比 π0.5(96.9% 成功率、93.6 毫秒、3.4B 参数、12.8GB 显存),TurboVLA 只用其 6% 的参数,成功率还更高。横向看延迟,π0 是 84.2 毫秒、OpenVLA 202.9 毫秒、SmolVLA 203.1 毫秒、VLA-JEPA 108.7 毫秒,TurboVLA 比它们都低一个量级,比 VLA-JEPA 快约 3 倍、参数是其 7%。双臂场景(RoboTwin 2.0)60.2% 成功率、43.4 毫秒、0.4B 参数;真机(AgileX Piper)四个任务分别 92.5%、80%、90%、87.5%。

为什么重要

对要把 VLA 部署到真机的人,这篇证明执行回路里那个大 LLM 不是必需的:砍掉它,延迟降到毫秒级、显存压到消费级显卡能跑、参数少两个数量级,任务成功率不掉。这意味着更高频的控制环和更便宜的硬件门槛。代价在下一节。

局限与存疑

TurboVLA 只擅长执行级的具体指令,做不了复杂语义理解和高层任务规划。作者自己说,复杂规划这种事更适合留给 LLM,本方法走的是高效执行这条路,未来可能是 LLM 规划加 TurboVLA 执行的组合。另外真机任务种类还有限,大规模泛化没在这篇验证。

术语

原文与代码

社区讨论

相关论文

全部论文解读