上海交大联合阿里提出 LA4VLA:解耦语言动作提升机器人策略

青稞AI · wechat · 2026-08-03

针对当前视觉-语言-动作(VLA)模型过度依赖视觉捷径、削弱语言约束的问题,上海交大联合阿里巴巴提出 LA4VLA。该方法在预训练阶段暂时去除视觉输入,使模型更专注地学习语言与动作的对应关系。

研究将语言-动作学习从视觉 grounding 中解耦,构建了 3.3 万规模的 vision-agnostic 数据集。实验表明,这种显式的语言-动作预训练范式不仅能作为标准 VLA 训练的有效互补信号,还能显著提升具身机器人的策略性能与面对视觉扰动时的鲁棒性。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →