上交团队提出 GSR:破解 VLA 模型指令泛化难题

机器之心 · wechat · 2026-08-06

当前视觉-语言-动作(VLA)模型在指令泛化上存在严重缺陷,仅改写任务表述便会导致动作执行成功率暴降。上海交大与无界动力的联合团队发现,这是因为等价措辞在多模态融合中引入了特征偏移,并被下游动作模块放大。

团队提出了 GSR(Grounded Semantic Re-Binding) 方法:使用冻结的 T5 编码器独立提取稳定的任务语义,并根据不同 VLA 架构重新注入特征流,最后重新训练动作专家。实验表明,该方法无需使用改写指令训练,即可让轻量级模型泛化能力大幅提升(如 SmolVLA 成功率从 4.47% 跃升至 49.12%),甚至对已预训练的大模型也有增益。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →