LIT 破解视觉捷径:真机成功率提升 13-17 个百分点
DJiafei · x · 2026-09-11
来自 NUS Magic Lab 等团队的论文《Breaking the Vision–Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models》提出 LIT,解决 VLA/世界动作模型中的视觉-动作捷径问题。
核心思路:光照、背景、相机视角在训练中可能与动作相关,导致策略学到虚假关联。LIT 分两阶段训练,共享同一个空间目标(末端执行器位姿):
- 第一阶段:不带图像,用语言指令、机器人状态和目标位姿训练动作专家「先学会动作」;
- 第二阶段:视觉特征经一组潜变量 token(监督其预测同一目标位姿)接入,再「学会用视觉」。主干与动作专家保留,仅改接口。
实验结果(YAM 双臂平台真机,3 个任务):
- 分布内成功率 88.0%(基线 74.7%,+13.3pp)
- 新光照 70.0%(+16.7pp)、新相机 46.7%(+16.7pp)、有干扰物 63.3%(+13.3pp)
- 加干扰物/模糊图像时基线轨迹大幅漂移而 LIT 基本不变;改变指令目标时只有 LIT 转向新目标
- 仿真 LIBERO-Plus 上对 π0.5 等四种架构均提升平均成功率且不损分布内性能
论文、代码与项目页均已开源。
所属事件:LIT 两阶段训练破解机器人视觉-动作捷径(4 条相关)→
「具身」频道最新
- 开源陪伴机器人 Lamp 新增灰尘温湿度感知,售价 499 美元 — dee_hw · 2026-09-11
- Cybertruck 成特斯拉工程试验场:48V、线控转向与以太环网 — XFreeze · 2026-09-11
- Apple 发布会三人组现场复盘:折叠 iPhone 与 Ternus 时代开局 — BenBajarin · 2026-09-11
- 2 万美元后院小屋:太阳能+星链+双 5090 组建私人 AI 数据中心 — dee_hw · 2026-09-11
- 红友全程 vibe coding 造出首块 PCB,花 130 欧打样即点亮成功 — a6m--zero · 2026-09-11
- DeepMind 开源果蝇全身仿真 flybody,59 维动作空间登上 Nature — ZeroStateReflex · 2026-09-11