听懂指令却做错动作,上交 GSR 给 VLA 换结构,成功率最多涨 44.6 个点

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

Zhaokai Yin, Zhipeng Zhang

cs.RO

2026-08-04

VLA 机器人遇到改写过的指令就崩。上交团队把根因定位到结构而非理解力,用冻结 T5 独立编码语义再注入,LIBERO-Para 成功率最高涨 44.6 个点。

这篇在解决什么

Vision-Language-Action(VLA)模型把图像和语言指令映射成机器人动作,在标准基准上表现很好。但有一个尴尬的失败模式:把「拿起红色物体」换成意思一样的「抓取那个红色的东西」,成功率就暴跌。论文测了 VLA-Adapter、SmolVLA、π0.5 三个当前最强的 VLA,改写指令后成功率最高掉 67.53 个百分点。

最常见的解法是「加数据」,训练时塞进大量同义改写。这条路有效但贵。作者的起点是一个反直觉的发现:模型其实听懂了。

方法

作者先做了一组诊断。在 LIBERO-Goal 上(十个任务共享同一视觉场景,只能靠语言区分),他们用改写指令让模型生成动作,再看这个动作最接近哪条标准指令的正确动作(Retrieval@1)。三个模型得分都高于随机,说明任务语义在内部特征里是保住的。接着是一个因果干预:在 VLA-Adapter 改写指令运行时,只把进入最后一个动作模块的语言特征,替换成标准指令运行时的对应特征,其余输入不动。成功率从 60% 跳到 96%,动作差异消除了 96.8%。结论是:语义没丢,丢在「把语义翻译成动作」这一步。

那为什么等价指令会产生不同特征?两个控制实验给了答案。一是把辅助语言分支看到的实时图像换成固定假图,改写成功率从 46.82% 升到 61.58%,说明动态视觉输入和文字一起编码放大了特征漂移。二是估计出 32 个区分标准与改写指令的方向并剔除,闭环成功率从 55% 升到 90%,可见措辞变化引入的是一种可分离的系统性偏移,而动作策略偏偏对它很脆弱。

修复方案叫 Grounded Semantic Re-binding(GSR):用一个冻结的 T5-large 单独编码指令(不给图像、不给机器人状态,语义因此稳定),投影后注入模型本来的多模态融合点,动作专家从头训练。训练只用十条标准指令任务,完全不碰改写数据。关键的一条原则是语言要先脱离当前画面独立编码,再回到融合流程里和视觉、状态深度交互。

不同架构注入位置不同。VLA-Adapter 把标准输入换成固定句子「perform the task」,逼模型只信 T5;π0.5 的原生输入本身对改写就稳,所以保留它、把 T5 当补充;SmolVLA 把 T5 特征注入 SmolVLM 的语言位置,让它在生成动作前先和画面深度交互。

结果

在 LIBERO-Para(4092 个改写回合)上:

模型原生 Full Para+GSR提升
VLA-Adapter46.82%70.94%+24.1
SmolVLA4.47%49.12%+44.65
π0.573.60%75.59%+2.0

π0.5 + GSR 的 PRIDE 分数到 70.4,超过此前最高的小米 Xiaomi-Robotics-0(69.2)。一个对照实验排除了「只是多了参数」这种解释:给 VLA-Adapter 加同样多的可训练参数但不带 T5,改写成功率纹丝不动地停在 46.82%。

冲突测试还揭示一个隐患:模型同时拿到原生输入和 T5 时,谁说了算?给 VLA-Adapter 的原生通道喂错指令,成功率从 47.31% 掉到 5.11%;给 T5 喂错只掉到 44%。也就是说原生通道不可靠却会「劫持」控制权,所以必须像 GSR 那样把它中和掉。

真机实验上,原生 VLA-Adapter 在共享场景下坍缩成与任务无关的动作,标准指令和改写指令都是 0% 成功;GSR 分别拿到 50% 和 40%。

为什么重要

这篇把「VLA 听不懂人话」这个锅,从数据量挪到了架构。对从业者意味着:如果你的 VLA 在指令改写下不稳,先别急着扩充语料,查一下任务语义是在哪一层和视觉混在一起、又在哪一层被翻译成动作。GSR 是一个相对轻的干预,冻结的 T5 每个任务只跑一次、缓存后不增加逐步推理开销,却能逼近用大规模数据训出来的模型。它也给了一个可迁移的诊断套路(逐层替换特征定位瓶颈),不局限于这三个模型。

局限与存疑

作者自己承认两点。一是 ParaVLA 这个彻底解耦的备选方案(语言用 T5、视觉用 DINOv2,只在最后融合),在扩大视觉骨干时撑不起 VLM 级别的 scaling,纯解耦换来了近乎完美的改写鲁棒性,却牺牲了扩展性。二是 GSR 要从头训练动作专家,π0.5 这种大动作模块在标准训练量下规范成功率会从 93% 略掉到 91%,得训两倍步数才回到 96%,大模型上 GSR 还缺一套高效初始化方案。

另一处存疑:真机实验只有 6 个任务、VLA-Adapter 一个模型,样本偏小;LIBERO-Para 的改写集中在动作表达和物体指代上,更自由的自然语言指令(多步、省略、指代歧义)这篇没覆盖。

术语

原文与代码

社区讨论

相关论文

全部论文解读