BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan
cs.RO
2026-08-06
BridgeVLA++ 在 BridgeVLA(点云投三视图、预测热力图再出动作)上加时空记忆:记忆基准 RMBench 从无记忆版 18.9% 拉到 96.0%、MemoryBench 到 99.7%,且不拖累空间任务,RLBench 还从 90.5% 提到 93.7%。
教机器人按语言指令做 3D 操作(抓、放、推、插),主流的视觉-语言-动作(VLA)模型有三个老毛病:吃数据、分布一变就垮、而且没有记忆,只看当前这一帧。没有记忆意味着两种任务做不动:一是要记「上一步做到了哪个子目标」的长链条任务(比如按对一组按钮的顺序),二是机械臂一伸就把目标挡住、得靠之前看到过的几何信息去定位的任务。
作者团队之前的 BridgeVLA 已经解决了前两个毛病,思路是把 3D 问题的输入和输出都摁回预训练视觉语言模型(VLM)原生处理的二维图像空间里。但 BridgeVLA 仍是严格的无记忆策略,每一步动作只由当前观察决定。BridgeVLA++ 就是在它上面加一套统一的时空记忆,把记忆能力补进来,同时不丢掉原来的数据效率和泛化。
先把 BridgeVLA 的做法讲清楚,因为加记忆是在它的骨架上动。输入侧:把彩色点云渲染成俯视、正视、右视三张正交投影图,VLM(这里用 PaliGemma)看到的就只是图片,连机器人本体状态都不喂进去,这样就保住了预训练时的图文对齐。输出侧:不把动作当成 token 序列去自回归预测,而是先在每张视图上预测一张二维平移热力图,把三个视图的候选点加权后取 argmax 反投影成末端的三维位移,旋转和夹爪开合再由一个小 MLP 补上。整个流程是「粗到细」两遍:先估一个粗略路点,再把点云裁剪放大、再预测一遍求精。预训练阶段在 12 万张 RoboPoint 定位数据上先学一遍热力图定位。
记忆就加在这套流程的视觉 token 空间里,分两路。时间记忆放在粗阶段,管「下一步该做什么」。它缓存三类 token:初始观察的三张锚点视图(固定参照,用来察觉场景变化)、最近 2 帧关键帧、以及一个可学习的自适应子目标门挑出来的里程碑关键帧。这个门用一个小 MLP 预测每帧的保留概率,把冗余帧压掉。空间记忆放在精阶段,管「到底往哪动」,专门对付遮挡。它把初始点云存下来,等粗阶段给出路点后,用同样的裁剪放大参数去重新渲染那份初始点云,让当前每个视图只去注意它对应的那张参考视图,把现在被挡住的几何信息补回来。
这么设计是有分工的:粗阶段俯瞰全局、决定下一个目标区域,所以时间记忆放这儿;精阶段定位精度最高、遮挡最致命,所以空间记忆放这儿。三段记忆都用 cross-attention 注入,当前视觉 token 当 query、记忆 token 当 key/value,加起来只多 2.7 亿参数(占 2.92B 主干的 9.2%),单步推理从 0.35 秒涨到 0.57 秒(单卡 RTX 4090)。
空间类基准上,记忆几乎是白送的好处。RLBench 上 BridgeVLA++ 平均成功率 93.7%,比 BridgeVLA 的 90.5% 还高,比此前 SOTA SAM2Act 的 86.8% 高出 6.9 个点。COLOSSEUM(14 种分布外扰动)平均 65.2%,略胜 BridgeVLA;在「全部扰动同时上」的严苛设置下 38.9%,是 BridgeVLA 18.7% 的两倍多。GemBench 平均 51.1%,略胜此前最优的 3D-LOTUS++(48.0%)。
真正拉开差距的是两个记忆基准。RMBench(双臂、九个任务)上,无记忆的 BridgeVLA 只有 18.9%,BridgeVLA++ 到 96.0%,比此前 SOTA MemoryWAM 的 83.0% 还高 13 个点,在试错排序类任务 Battery Try 上是 96% 对 41%。MemoryBench(单臂)上,BridgeVLA 只有 11.3%,BridgeVLA++ 到 99.7%,每个随机种子都不低于 99.3%。
| 基准 | BridgeVLA(无记忆) | BridgeVLA++ | 此前 SOTA |
| RLBench(空间) | 90.5 | 93.7 | 86.8(SAM2Act) |
| RMBench(记忆,双臂) | 18.9 | 96.0 | 83.0(MemoryWAM) |
| MemoryBench(记忆,单臂) | 11.3 | 99.7 | 94.3(SAM2Act+) |
真机也验证了。在 Dobot 双臂上,三个记忆相关任务的平均成功率从 BridgeVLA 的 20.0% 拉到 93.3%,是 SAM2Act+ 的三倍。数据效率一直是 BridgeVLA 的强项:真机 Franka 上每个任务只给 3 条演示,BridgeVLA 就能做到 95.4%;相比之下用同一套 PaliGemma 主干的 π0.5,10 条演示才 20%,说明省数据靠的是输入输出对齐这套设计,不是主干本身。
消融说明分工成立:拿掉时间记忆,RMBench 从 96.0% 掉到 21.3%(几乎回到无记忆基线),说明记忆任务主要靠时间记忆扛;拿掉空间记忆,RMBench 几乎不掉,但在 RLBench 的遮挡类任务(如 Sort Shape)上有针对性提升。而拿掉 BridgeVLA 的热力图解码,RLBench 会从 90.5% 崩到 31.4%,印证了热力图这套输出设计才是地基。
对做机器人操作的人来说,BridgeVLA++ 给了一个能同时拿到三样的方案:省数据、抗分布漂移、还能记。过去这三者基本是分开做的,这套在记忆基准上拿 SOTA 的同时没让普通空间任务退步,说明记忆是可以「白加」的。
方法层面最有迁移价值的,是它把记忆摁在 VLM 的视觉 token 空间里,而不是另起一套外部记忆模块。这样动作接口(热力图)完全不用动,记忆注入用 cross-attention 就够,代价是参数和延迟各涨一成。子目标门那个可学习的筛选器也值得借:与其无差别存每一步,不如学一个门控挑里程碑帧,避免近重复帧把关键历史稀释掉。
论文没有专门的「局限」小节,只零散提到几处。最明显的是类别泛化:真机遇到没见过的物体类别时,策略有时会无视目标物体直接奔目的地,作者归因于预训练图片多为第三人称视角、和机器人的正交渲染对不上,以及定位监督用的是物体级而操作关键点未必落在物体上。
子目标门目前依赖每个任务段的语言标注来训练(把每段最后一帧当正样本),在没有这类标注的基准上只能关掉、只保留最近 2 帧;作者把「换成自监督」列为未来工作。长程基准 GemBench L4 上所有端到端方法都接近零,BridgeVLA++ 也只有 8.2%,远谈不上解决长程。RMBench 是每个任务挑最优 checkpoint、单次 100 局评测,没有像别处那样多随机种子取平均,方差没报。表格里也没有和 RT-1、OpenVLA、3D-VLA 这些常见 2D VLA 直接比(它们只在工作里被提一句),想横向比这几个得自己补。