华科联合华为推TurboVLA:绕开LLM实现32Hz高频机器人控制
机器之心 · wechat · 2026-08-03
现有视觉-语言-动作(VLA)模型通常将大语言模型(LLM)作为视觉到动作的中间接口,导致计算开销大、动作延迟高。针对这一问题,华中科技大学联合华为提出了实时视觉-语言-动作模型 TurboVLA。
核心架构创新
TurboVLA 做了“减法”,绕开了 LLM 这一中间接口,采用更直接的 V+L→A 路径:
- 使用 DINOv3 和轻量文本编码器(如 BERT)分别处理视觉和语言指令。
- 通过双向视觉-语言交互建立任务与场景的对应关系。
- 交互后的特征直接输入轻量动作解码器,一次前向传播即可并行输出连续动作块。
性能与效率优势
- 极低延迟:在单张 RTX 4090 上,端到端策略延迟仅为 31.2ms(约 32Hz),运行显存占用仅 0.9GB。
- 参数极少:在 LIBERO 基准下模型参数量仅为 0.2B,平均成功率达到 97.7%,超越了 3.4B 参数的 π0.5(96.9%),且延迟降低至其三分之一。
- 真实世界验证:在双臂仿真和真实机械臂测试中均表现出优异的操作性能。
该研究证明,在明确的机器人操作任务中,动作预测未必每次都需要重新运行 LLM。未来由 LLM 负责高层规划、TurboVLA 负责低延迟执行的分层系统,将是更高效的技术路线。
「具身」频道最新
- N_0-TWAM: 首个大规模触觉原生世界-动作模型 — NeoteAIEmbodied · 2026-08-03
- comma.ai 复盘自动驾驶模型早期离谱 Bug — dosco · 2026-08-03
- 对话超维动力罗平:具身模型的核心是打通人类数据到机器人的闭环 — 机器之心 · 2026-08-03
- VOCA:利用视频编解码器信息提升视觉里程计追踪性能 — rsasaki0109 · 2026-08-03
- 双足还是轮式?家庭机器人的现实空间困境 — carlosdponx · 2026-08-03
- 人形机器人量产拐点未至:投行百万级预测与实际出货量悬殊 — atShruti · 2026-08-03