先学动作再学视觉:LIT 两阶段训练让 VLA 泛化成功率大幅提升
DJiafei · x · 2026-09-11
- 问题:训练数据里背景、相机角度、光照可能与演示动作相关,VLA/WAM 的动作专家容易学到视觉捷径,换场景就翻车。
- 方法 LIT(Latent Interface Training) 分两阶段:
- 先学动作:动作专家不看图像,只依赖语言、机器人状态和每段动作块的末端末端执行器位姿进行训练;
- 再学用视觉:以第一阶段初始化,视觉信息只通过一个被监督重建同样末端位姿的隐空间接口进入,引导视觉表征保留与目标相关的空间信息。
- 结果:在 LIBERO-Plus 上四种架构平均成功率全面提升——π0.5 从 68.97%→79.67%,MolmoAct2 从 63.62%→71.92%,FAST-WAM 从 51.44%→60.63%,ImageWAM 从 83.02%→86.89%;真实世界实验中 MolmoAct2 用 300 条演示学 3 个任务,新光照场景从 53.3%→70.0%,仅顶置相机从 30.0%→46.7%,有干扰物从 50.0%→63.3%,分布内从 74.7%→88.0%。
所属事件:LIT 两阶段训练破解机器人视觉-动作捷径(4 条相关)→
「具身」频道最新
- Skild 营收破 1 亿美元年化,小鹏启动 IRON 产线 — xmercury_one · 2026-09-11
- Gary Marcus:机器人领域别重蹈对齐欠账的覆辙 — GaryMarcus · 2026-09-11
- LIT 方法破解 VLA 视觉-动作捷径,提升机器人泛化 — DJiafei · 2026-09-11
- 机器人差点成功落地:训练进展显著但仍需稳住 — hbouammar · 2026-09-11
- 机器人练侧踢屡败屡战,从差点摔倒到接近成功 — 0xSammy · 2026-09-11
- 机器人会跳舞会武术还完了铁人三项,却还学不会洗碗 — tinyfool · 2026-09-11