蒸馏世界模型表征进 VLA:0.8B 小模型 LIBERO 达 97.9%
Trung Dao · hf · 2026-09-22
VLA 模型直接把观测映射到动作,缺少对「世界如何响应」的目标,稳健性受限于数据覆盖;世界模型虽有这一目标,但逐步推演未来每步要数秒,进不了控制回路。本文证明两者可以解耦:世界模型对物理场景的知识存在于其内部特征,生成未来只是产生这些特征的目标。方法极其简单——在普通 VLA 训练上加一个特征对齐项:冻结的世界模型对训练帧只跑一次并缓存,学生学习对齐该缓存。训练时不加载教师,训练后丢弃投影器,部署策略与未蒸馏基线完全相同:RTX 5090 上 32ms、1.86GB,所有增益都来自表征而非额外容量或测试时计算。
结果:0.8B 学生模型在 LIBERO 达 97.9%,RoboCasa-GR1 人形操作从 48.2% 提至 50.5%,并迁移到单臂与双臂真机平台。增益在学生规模、backbone、对齐层与教师更换后依然成立,说明是广泛的表征先验而非两个特定网络的脆弱对齐。
「具身」频道最新
- 无摄像头 AI 眼镜 VONDER 发布:骨传导麦克风,299 美元起预订 — alex_verem · 2026-09-22
- 机器人公司破局之道:先部署再用协同感知补能力短板 — broodsugar · 2026-09-22
- 机器人 Astra 自主给自己的身体装上新模块,作者直呼意外 — mhmazur · 2026-09-22
- 「可提示硬件」探索:让 AI agent 住进日常物品的 50 个概念 — genmon · 2026-09-22
- iRobot 破产后,前三星工程师开源扫地机器人 OOMWOO 44 天获千星 — Aiden_Tech_Ai · 2026-09-22
- 微软 ShieldVLA 用 HJ 可达性做 VLA 安全对齐,安全成本平均降 57% — MicrosoftResearch · 2026-09-22