浙大达摩院给VLA加纠偏层,π0.5成功率从48.7%升至64.4%

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

cs.RO

2026-07-02

浙大与达摩院给冻结的VLA加40M潜空间监视器:动作块跑偏就截断,再用梯度引导重规划。MetaWorld上π0.5成功率从48.7%升到64.4%,真机扰动任务从40.0%升到68.3%。

这篇在解决什么

生成式VLA为了少调策略、动作更顺,一次推出一串未来动作,再开环执行固定长度的action horizon。Horizon越长,推理次数越少,盲区也越大:接触、打滑、位姿一偏,过期动作还在跑,误差会在开环窗口里放大到无法挽回。

这篇把这个权衡量化了。π0.5上把horizon拉长,策略调用大约降到四分之一,成功率从约64%掉到49%以下;SmolVLA和X-VLA同一方向。H=1能救成功率,但每步都要跑一遍VLA,chunking的意义没了。固定horizon很难预先选对,因为最佳长度跟着任务难度、环境动态和sim-to-real缺口走。

方法

VLA-Corrector是推理期插件,不改骨干权重。先在benchmark演示上冻住VLA视觉编码器,另训一个约40M的MLP,输入当前视觉latent和刚执行的动作,预测短时视觉残差。损失是L2加余弦方向。它不学完整世界模型,只学「还在正轨上时,画面该怎么变」。演示里有遥操作抖动也没关系,只要整体仍在把任务往前推。

部署时Latent-space Vision Monitor用这个预测和真实观测算不一致分数Et=1−余弦相似度。滑窗中位数和MAD给出自适应开关阈值,连续多步超过Ton才截断,单帧噪声不触发。截断后丢掉队列里剩下的过期动作,固定horizon变成事件触发的自适应horizon。

截断之后不只是再问一次策略。Online Gradient Guidance只作用在紧接着的那一次生成:用漂移前的预期残差减去已积累偏差,得到纠正方向,再把「当前候选动作造成的视觉变化」往这个方向拉,梯度打进flow matching的速度场。η默认1。监测器和策略必须拆开:把同样的残差头接到骨干上一起微调,平均成功率只有49.55%,外挂LVM能到64.35%。内部头会改写本来用于规划的表征,外部头在冻结特征上干活,不动策略。

结果

MetaWorld按难度拆开,三个骨干都涨,难任务更明显。

骨干基线平均成功率+Corrector
π0.548.70%64.35%(+15.65,Very Hard从41.0%到65.0%)
SmolVLA61.90%66.65%(+4.75)
X-VLA55.55%59.60%(+4.05)

Horizon扫描里,成功不是靠多问策略换来的。π0.5在H=50时成功率从48.72%到58.70%,每回合调用从5.15到4.98,success-per-call提升24.6%;SmolVLA在H=10时从61.90%到73.00%,调用从19.27到15.64,效率提升45.3%。LIBERO上,few-shot的π0.5加Corrector平均97.80%,超过全量微调的96.95%。真机AgileX PiPER六自由度臂、三组任务各三项各20次:平均从55.6%到73.3%,扰动恢复从40.0%到68.3%,这一组增益最大。

消融:只截断就到60.35%,再加上OGG到64.35%。83.7%的截断发生在抓取、对准这类关键阶段,非关键阶段只占16.3%。截断后10步内恢复,OGG平均再加0.23。Corrector用60%演示已超过基线;LIBERO上训的corrector搬到MetaWorld只能从48.7%到51.8%,域内才能到58.7%。OGG打开后墙钟大约1.62–1.68倍,均摊到每环境步大约多7.93毫秒;一次普通chunk推理约278ms,一次OGG恢复查询约588ms。

为什么重要

VLA部署里horizon是个脏开关:短了算力吃不消,长了接触任务不稳。这篇证明可以不改大模型,用一个小监测器决定「这段chunk还能不能信」。对已经冻好的π0.5、SmolVLA、X-VLA,这是即插即用的推理补丁。few-shot轨迹往往已经覆盖正常路径,却盖不住跑偏后的恢复;不一定要靠堆微调数据来教这件事。

这是渐进补丁,不是新VLA。它吃的是「执行是否仍像演示」,演示分布外的失败它救不了。

局限与存疑

作者在真机失败分析里写得很清楚:目标被挪出工作空间、夹爪已经进了坏姿态、没有力觉的紧配合、遮挡和低对比,单次纠偏都可能不够。OGG只能偏置骨干已经会的动作,变不出策略表示不了的恢复技能。

监测器在演示上训练,对「成功执行长什么样」有偏;跨域只有3.1个点,换机器人、换相机不能默认能用。跨架构表里的64.35%和H=50扫描里的58.70%不是同一套聚合,引用时要看设置。OGG恢复查询大约588ms,高频控制未必吃得下。没有跟需要额外恢复数据或单独恢复策略的方法做直接对照。η拉到10或100,更难的任务会掉下去,引导过猛会把动作拉歪。

术语

原文与代码

社区讨论

相关论文

全部论文解读