LIT 两阶段训练破解机器人视觉-动作捷径
NUS Magic Lab 等团队提出 Latent Interface Training(LIT):标准 VLA 和世界动作模型直接在视觉表征上训练动作专家,但训练数据中背景、相机角度、光照常与示范动作相关,导致模型学到视觉捷径,在新场景失效。LIT 采用两阶段策略,先学动作再学用视觉,破解该捷径后真机成功率提升 13 至 17 个百分点,显著改善训练分布之外的泛化能力。
2026-09-11 ~ 2026-09-11 · 4 条相关
- LIT 方法破解 VLA 视觉-动作捷径,提升机器人泛化 — DJiafei · 2026-09-11
- 先学动作再学视觉:LIT 两阶段训练让 VLA 泛化成功率大幅提升 — DJiafei · 2026-09-11
- LIT 破解视觉捷径:真机成功率提升 13-17 个百分点 — DJiafei · 2026-09-11
另有 1 条近重复转述:DJiafei