LIT 破解视觉捷径:真机成功率提升 13-17 个百分点

DJiafei · x · 2026-09-11

来自 NUS Magic Lab 等团队的论文《Breaking the Vision–Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models》提出 LIT,解决 VLA/世界动作模型中的视觉-动作捷径问题。

核心思路:光照、背景、相机视角在训练中可能与动作相关,导致策略学到虚假关联。LIT 分两阶段训练,共享同一个空间目标(末端执行器位姿):

实验结果(YAM 双臂平台真机,3 个任务):

论文、代码与项目页均已开源。

所属事件:LIT 两阶段训练破解机器人视觉-动作捷径(4 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →