TurboVLA:0.2B 参数在 RTX 4090 上实现 32Hz 机器人推理
_akhaliq · x · 2026-07-31
现有的视觉-语言-动作(VLA)模型通常采用以大语言模型为中心的 V→L→A 路径,导致每次推理的计算和内存开销巨大。
论文提出 TurboVLA,将传统路径重构为直接的 V+L→A 映射。它不再使用 LLM 作为感知和动作的中间接口,而是独立编码视觉和语言指令,通过轻量级的双向交互直接预测连续动作块。
在 LIBERO 基准上,TurboVLA 仅用 0.2B 参数,在消费级 RTX 4090 上实现了 97.7% 的平均成功率,推理延迟仅 31.2 毫秒,显存占用不到 1GB,性能媲美甚至超越参数量庞大的 VLA 策略。
所属事件:TurboVLA 模型重构推理路径,消费级显卡实现高频机器人控制(2 条相关)→
「具身」频道最新
- 极客自制背包摄像头:香橙派驱动实时检测蚊子 — yacineMTB · 2026-07-31
- Google DeepMind 新模型登场:让人形机器人实现全身运动 — The Verge AI · 2026-07-31
- πR^2框架:让机器人操作策略实现40毫秒级实时反应 — CMU-SCS · 2026-07-31
- 消费级人形机器人何时普及?Reddit 网友预测三年内降至 5000 美元 — Terminator857 · 2026-07-31
- 全球最大「物理 AI」数据引擎正进一步扩大规模 — pduan · 2026-07-31
- NVIDIA 发布 Jetson AGX Thor:专为具身智能打造的机器人大脑 — NVIDIA Developer · 2026-07-31