TurboVLA:消费级显卡实现 32Hz 机器人实时控制
H-EmbodVis · hf · 2026-07-30
现有的视觉-语言-动作(VLA)模型通常以大语言模型(LLM)为中心,将视觉观测投射到语言空间后再解码为动作,这带来了巨大的计算和内存开销。
研究团队提出了 TurboVLA,将传统的“视觉→语言→动作”路径重构为直接的“视觉+语言→动作”映射。该架构独立编码视觉和语言指令,通过轻量级的双向交互生成连续的动作块,大幅降低了推理成本。
在 LIBERO 基准测试中,TurboVLA 仅用 0.2B 参数,就在消费级 RTX 4090 显卡上实现了 97.7% 的平均成功率。其推理延迟仅为 31.2 毫秒(32 Hz),显存占用不到 1GB,性能媲美甚至超越了参数量大得多的主流 VLA 策略。
「具身」频道最新
- 具身智能基础设施公司Ropedia完成3000万美元融资 — liuziwei7 · 2026-07-30
- 开源自主无人机 Langostino:结合 ROS2 与强化学习 — tom_doerr · 2026-07-30
- 单次人类演示即学会用剪刀,新框架实现机器人灵巧工具操作 — HaozhiQ · 2026-07-30
- 具身智能新测试:顶级 VLM 缺乏身体感知,成功率仅 16.8% — metaresearch · 2026-07-30
- 揭秘机器人演示常见套路:夹爪预设物体伪装抓取 — chris_j_paxton · 2026-07-30
- 马斯克断言金钱将在2036年失去意义 — r0ck3t23 · 2026-07-30