蒸馏世界模型表征进 VLA:0.8B 小模型 LIBERO 达 97.9%

Trung Dao · hf · 2026-09-22

VLA 模型直接把观测映射到动作,缺少对「世界如何响应」的目标,稳健性受限于数据覆盖;世界模型虽有这一目标,但逐步推演未来每步要数秒,进不了控制回路。本文证明两者可以解耦:世界模型对物理场景的知识存在于其内部特征,生成未来只是产生这些特征的目标。方法极其简单——在普通 VLA 训练上加一个特征对齐项:冻结的世界模型对训练帧只跑一次并缓存,学生学习对齐该缓存。训练时不加载教师,训练后丢弃投影器,部署策略与未蒸馏基线完全相同:RTX 5090 上 32ms、1.86GB,所有增益都来自表征而非额外容量或测试时计算。

结果:0.8B 学生模型在 LIBERO 达 97.9%,RoboCasa-GR1 人形操作从 48.2% 提至 50.5%,并迁移到单臂与双臂真机平台。增益在学生规模、backbone、对齐层与教师更换后依然成立,说明是广泛的表征先验而非两个特定网络的脆弱对齐。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →