机器人VLA易学视觉捷径,LIT两阶段训练先学动作再学用视觉

DJiafei · x · 2026-09-11

标准 VLA/WAM 直接在视觉表征上训练动作专家,但训练数据中背景、相机角度、光照可能与示范动作相关,导致模型依赖这些视觉捷径,换到新场景就失效。

LIT(Latent Interface Training) 把训练重构为两阶段:

这样在约束视觉条件依赖的同时,保住目标相关的空间信息,缓解分布外场景下的失效。

所属事件:LIT 两阶段训练破解机器人视觉-动作捷径(4 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →