让机器人从视频学技能,CD-LAM 去偏框架提升 12 倍效率

jiqizhixin · x · 2026-08-08

Aether AI 与加州大学圣地亚哥分校(UC San Diego)联合提出了新训练框架 CD-LAM(Causally Debiased Latent Action Model),旨在解决 AI 从视频中学习机器人技能时的动作混淆问题。

现有模型在学习视频时,常将核心动作与无关的背景或杂物混为一谈。CD-LAM 通过在微调阶段引入三种去偏技巧,强制模型仅关注与动作相关的动态变化,从而提取出更纯净、可控的潜在动作表征。

实验表明,该框架在动作跟随、视觉保真度及效率上均优于 DreamDojo 基线。在 140 亿(14B)参数规模下,它仅需少于原来 12 倍的机器人动作适应更新次数即可达到同等效果,并在 20 亿(2B)规模上同样取得显著提升。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →