TurboVLA:消费级显卡实现 32Hz 机器人实时控制

H-EmbodVis · hf · 2026-07-30

现有的视觉-语言-动作(VLA)模型通常以大语言模型(LLM)为中心,将视觉观测投射到语言空间后再解码为动作,这带来了巨大的计算和内存开销。

研究团队提出了 TurboVLA,将传统的“视觉→语言→动作”路径重构为直接的“视觉+语言→动作”映射。该架构独立编码视觉和语言指令,通过轻量级的双向交互生成连续的动作块,大幅降低了推理成本。

在 LIBERO 基准测试中,TurboVLA 仅用 0.2B 参数,就在消费级 RTX 4090 显卡上实现了 97.7% 的平均成功率。其推理延迟仅为 31.2 毫秒(32 Hz),显存占用不到 1GB,性能媲美甚至超越了参数量大得多的主流 VLA 策略。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →