BridgeVLA++ 框架引入时空记忆,大幅提升 3D 机器人操作泛化性

Peiyan Li · hf · 2026-08-06

研究团队推出 BridgeVLA++,一种具备记忆增强能力的视觉-语言-动作(VLA)框架,专为 3D 机器人操作设计。现有 3D VLA 方法普遍存在数据消耗大、分布外泛化弱以及缺乏历史观察记忆等局限。

BridgeVLA++ 在前代模型将点云投影为多视图图像的基础上,引入了统一的时空记忆架构,能够同时建模持久的空间上下文和历次交互的时间历史。实验表明,该框架不仅在空间操作任务上表现强劲,还在两个极具挑战性的记忆依赖型基准测试中达到 SOTA 水平。此外,它在双臂操作场景及真实机器人平台上均得到有效验证,证明了其在跨任务、跨环境及跨硬件平台上的强大扩展能力。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →