上海交大联合阿里提出 LA4VLA:解耦语言动作提升机器人策略
青稞AI · wechat · 2026-08-03
针对当前视觉-语言-动作(VLA)模型过度依赖视觉捷径、削弱语言约束的问题,上海交大联合阿里巴巴提出 LA4VLA。该方法在预训练阶段暂时去除视觉输入,使模型更专注地学习语言与动作的对应关系。
研究将语言-动作学习从视觉 grounding 中解耦,构建了 3.3 万规模的 vision-agnostic 数据集。实验表明,这种显式的语言-动作预训练范式不仅能作为标准 VLA 训练的有效互补信号,还能显著提升具身机器人的策略性能与面对视觉扰动时的鲁棒性。
「具身」频道最新
- Tacta Systems携7500万美元融资推出灵巧机器人手TactaBot — ZeYanjie · 2026-08-03
- 中国家政机器人约 17 美元清洁 3 小时,还配人类监督 — MarwaEldiwiny · 2026-08-03
- GitHub 开源 7 自由度人形机械臂,助力物理 AI 研究 — tom_doerr · 2026-08-03
- 人形机器人进物流中心:RobotEra M7 每小时分拣 1200 件包裹 — CyberRobooo · 2026-08-02
- 仅用 30 秒视频,新 AI 学会了跑酷 — Two Minute Papers · 2026-08-02
- 美国 FCC 以国安为由禁止进口境外人形机器人 — heatherknight · 2026-08-02