机器人VLA易学视觉捷径,LIT两阶段训练先学动作再学用视觉
DJiafei · x · 2026-09-11
标准 VLA/WAM 直接在视觉表征上训练动作专家,但训练数据中背景、相机角度、光照可能与示范动作相关,导致模型依赖这些视觉捷径,换到新场景就失效。
LIT(Latent Interface Training) 把训练重构为两阶段:
- 先学动作:不输入图像,仅以语言、机器人状态和每个示范动作块的末端执行器终点位姿为条件训练动作专家。
- 再学用视觉:用第一阶段的动作专家初始化,加入视觉条件——但视觉信息只通过一个潜在接口传入,并用重建同一终点位姿来监督该接口,促使它保留与目标相关的空间信息。
这样在约束视觉条件依赖的同时,保住目标相关的空间信息,缓解分布外场景下的失效。
所属事件:LIT 两阶段训练破解机器人视觉-动作捷径(4 条相关)→
「具身」频道最新
- Skild 营收破 1 亿美元年化,小鹏启动 IRON 产线 — xmercury_one · 2026-09-11
- Gary Marcus:机器人领域别重蹈对齐欠账的覆辙 — GaryMarcus · 2026-09-11
- LIT 方法破解 VLA 视觉-动作捷径,提升机器人泛化 — DJiafei · 2026-09-11
- 机器人差点成功落地:训练进展显著但仍需稳住 — hbouammar · 2026-09-11
- 机器人练侧踢屡败屡战,从差点摔倒到接近成功 — 0xSammy · 2026-09-11
- 机器人会跳舞会武术还完了铁人三项,却还学不会洗碗 — tinyfool · 2026-09-11