让机器人从视频学技能,CD-LAM 去偏框架提升 12 倍效率
jiqizhixin · x · 2026-08-08
Aether AI 与加州大学圣地亚哥分校(UC San Diego)联合提出了新训练框架 CD-LAM(Causally Debiased Latent Action Model),旨在解决 AI 从视频中学习机器人技能时的动作混淆问题。
现有模型在学习视频时,常将核心动作与无关的背景或杂物混为一谈。CD-LAM 通过在微调阶段引入三种去偏技巧,强制模型仅关注与动作相关的动态变化,从而提取出更纯净、可控的潜在动作表征。
实验表明,该框架在动作跟随、视觉保真度及效率上均优于 DreamDojo 基线。在 140 亿(14B)参数规模下,它仅需少于原来 12 倍的机器人动作适应更新次数即可达到同等效果,并在 20 亿(2B)规模上同样取得显著提升。
「具身」频道最新
- Dyna Robotics 预告机器人即将迎来重大突破 — JasonMa2020 · 2026-08-08
- Dyna Robotics 预告机器人领域重大突破:非演示 — JasonMa2020 · 2026-08-08
- CoRL 2026 机器人世界模型研讨会公布征稿日程 — mengyer · 2026-08-08
- Wayve 发布 GAIA-4 世界模型:攻克自动驾驶安全仿真难题 — alexgkendall · 2026-08-08
- 谷歌展示Gemini Robotics ER 2新演示 — ColbyHawker · 2026-08-08
- 优化奖励函数让机器人 RL 训练提速 5 倍 — carlosdponx · 2026-08-08