LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion
Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang
RSS 2026
cs.RO
2026-02-13
北大、Galbot 等把策略与动力学放进同一套 MM-DiT,用 DINO 特征代替像素,吃进 3 万小时人机杂数据。仿真成功率 55.4%,真机倒垃圾 35% 对基线 0,混入低质轨迹再涨 10 点。
机器人基础模型现在的主流路径是大规模行为克隆:只模仿专家动作。质量不够的遥操作、带停顿和重试的轨迹、没有动作标注的人手视频,多数被丢掉。这些「差数据」里仍有可迁移的接触物理:物体怎么动、力怎么传、失败之后场景变成什么样。扔掉等于把动力学先验清掉,只留下一条又窄又贵的专家示范管道。
Unified World Model(UWM,统一世界模型)本来可以把策略、前向动力学、逆向动力学和视觉预测塞进同一个扩散模型,理论上能吃杂数据。现有实现卡在两处。数据角色不分,好轨迹和差轨迹共用一套损失,噪声动作会直接污染策略。未来状态还在像素或 VAE 潜空间里预测,光照、纹理、背景会盖过真正的接触变化。模型扩到十亿参数,潜空间拆不开外观和动力学,照样扩不动。
LDA-1B 做了两件事:按质量给数据派任务,把未来状态的预测目标换成结构化的 DINO 特征。
数据分工很硬:
四个可学习的 task embedding 加到扩散时间步上,告诉网络当前在解哪道题。缺的模态用 register token 占位:训策略时未来视觉是占位符,训视觉预测时动作是占位符。目标是 flow matching,学从噪声指向数据的速度场,动作损失和视觉损失按任务开关。
视觉不重建像素。DINOv3-ViT-s 抽出 14×14×384 的语义特征,背景和外观扰动被压下去,模型被迫去拟合「动作之后物体去了哪」。动作统一成手心坐标系:腕部 delta 位姿,加夹爪开合宽度或相对手腕的手指关键点。视觉 3 Hz、动作 10 Hz,相邻高相关帧少算一遍。
骨干是 MM-DiT。动作专家和视觉专家各自保留 QKV 与 FFN,中间用共享自注意力对齐两条异步流,语言靠 cross-attention 从冻结的 Qwen3-VL-4B 灌进来。预训练只更新约 1B 的 MM-DiT 和动作编解码,DINO 也冻着。48 张 H800,40 万步,4608 GPU 小时。微调再解开 VLM,并继续吃未筛选的遥操作数据。
配套数据集 EI-30k:真机 8030 小时、仿真 8600 小时、带动作的人 7200 小时、无动作人手视频 1 万小时,全部转成 LeRobot 格式,末端坐标系手工对齐。
仿真厨房基准 RoboCasa-GR1,24 个任务,每任务 1000 条微调、51 次评测:
| 方法 | 视觉表示 | 成功率 |
| GR00T-N1.6(3B) | 无显式动力学 | 47.6% |
| GR00T-EI10k(1B,同数据高质量子集) | 无显式动力学 | 51.3% |
| UWM + MM-DiT | VAE | 20.0% |
| LDA(标准 DiT) | DINO | 48.9% |
| LDA-1B | DINO | 55.4% |
VAE 换成 DINO,成功率从 20.0% 跳到 55.4%。去掉 MM-DiT 掉 6.5 个点,缩到 0.5B 掉 4.7 个点。数据和参数能解释一小截,潜空间结构解释了更大一块。
真机在预训练没见过的 Galbot G1 上做 few-shot。抓取放置 80%–90%;「翻盒子」60%(GR00T 20%);「浇花」80%(π0.5 为 60%);长程「倒垃圾」LDA 35%,两个基线都是 0。灵巧手上,「拔钉子」80%(π0.5 接近 0,GR00T 40%),「翻面包」90%(两个基线都是 10%)。摘要给出相对 π0.5 的分项上限:接触丰富 21%、灵巧 48%、长程 23%。
未见物体和背景的抓取放置,LDA 60%,GR00T 40%,π0.5 约 27% / 20%;OOD 初始位 40%,对照 20% 和 6.7%。
混质微调更刺眼。放笔入盒:LDA 高质量 70% 混入低质后 80%,π0.5 从 60% 掉到 40%。双手揭盖:LDA 50% 到 60%,π0.5 50% 到 40%。大约三成通常被丢掉的差轨迹,在这套目标分工下值 10 个点。
缩放曲线上,动作预测 L1 误差随数据到 3 万小时降到 6.6。只训策略时,混进低质数据会变差;四个目标开齐之后,再加 1 万小时无动作视频还能继续降误差。
给机器人预训练一个能落地的配方:差数据别当噪声扔,拆成动力学监督。像素世界模型在十亿参数附近已经不好扩,换语义潜空间比继续堆 DiT 层更值钱。部署侧,遥操作不用先筛专家轨迹,采集成本会下来。Galbot G1 不在预训练里也能 few-shot 上去,手心动作空间至少在这几个平台上是通的。
这仍是渐进拼装,不是新范式。UWM 的四个目标都是现成的,贡献在数据角色、DINO 潜空间和 MM-DiT 的工程组合,以及把异构数据对齐到 3 万小时。真机每任务大约 10 到 20 次试验,数字方差不会小。
作者自己写了:DINO 特征冻死,视角几乎全是头戴第一人称,换新视角或多模态传感器可能撑不住。
另外几处读完站不稳。真机基线只在筛过的专家子集上微调,LDA 吃全部 100 条,「差数据有用」和「多 30% 数据有用」缠在一起。坐标系靠人工对齐,接到第 4 万小时未必还做得到。图注写 1.6B 参数,表和标题写 1B 可训练参数,口径不统一。倒垃圾 35% 赢了 0,离能用还远。缩放代理是 Agibot World 持出集上的动作 L1,和真机成功率之间还隔着一层。