TurboVLA:0.2B 参数在 RTX 4090 上实现 32Hz 机器人推理

_akhaliq · x · 2026-07-31

现有的视觉-语言-动作(VLA)模型通常采用以大语言模型为中心的 V→L→A 路径,导致每次推理的计算和内存开销巨大。

论文提出 TurboVLA,将传统路径重构为直接的 V+L→A 映射。它不再使用 LLM 作为感知和动作的中间接口,而是独立编码视觉和语言指令,通过轻量级的双向交互直接预测连续动作块。

在 LIBERO 基准上,TurboVLA 仅用 0.2B 参数,在消费级 RTX 4090 上实现了 97.7% 的平均成功率,推理延迟仅 31.2 毫秒,显存占用不到 1GB,性能媲美甚至超越参数量庞大的 VLA 策略。

所属事件:TurboVLA 模型重构推理路径,消费级显卡实现高频机器人控制(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →