世界模型特征蒸馏进0.8B VLA,LIBERO到97.9%仍32毫秒

Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies

Trung Dao, Sankalp Yamsani, Jaden Park, Joohyung Kim, Yong Jae Lee

cs.RO, cs.CV

2026-09-21

威斯康星与 UIUC 把冻结世界模型的视觉特征缓存下来,用一条余弦对齐加进普通 VLA 训练。0.8B 学生 LIBERO 从 95.3% 到 97.9%,RoboCasa-GR1 从 48.2% 到 50.5%。部署图与未蒸馏基线完全相同,RTX 5090 上 32 毫秒、1.86 GB。

这篇在解决什么

VLA 只学「看见什么就输出什么动作」,没有压力去建模世界会怎么回。鲁棒性几乎完全取决于演示覆盖,换视角、换光、换杂乱就脆。世界模型反向:靠预测未来逼出时间和因果结构,迁移更好,但滚动未来太贵。DreamZero 在 H100 上约 3 秒一次、45.9 GB;π0.5 在消费级 RTX 5090 上 65 毫秒。世界模型进不了控制环。

这篇把「世界模型知道什么」和「生成未来」拆开。物理场景的知识已经在内部特征里,生成只是练出这些特征的目标。学生可以对齐特征,不必会做梦。

方法

学生是 QwenGR00T:Qwen3-VL 系视觉语言骨干加 GR00T 式 flow matching 动作头。主损失仍是演示动作的速度回归,不用教师动作。额外一项:把每个相机的图像 token 均值池化,经两层 MLP 投到教师宽度,与缓存的教师特征做余弦对齐,λ=0.5。

教师默认取 Cosmos 3 理解塔里的 Qwen3-VL-8B,第 24 层图像隐状态,每视角 4096 维。教师对训练帧只跑一次,结果写入内存映射缓存。训练期不加载教师,对齐头训练结束即丢。推理仍是一次骨干 prefill 加四步 flow,图与未蒸馏学生相同。

结果

LIBERO 四套件、每任务 50 回合,跨 2 个种子 × 2 块 GPU 取平均。蒸馏 0.8B:Spatial 99.3、Object 99.2、Goal 99.4、LIBERO-10 93.8,均分 97.9±0.5。未蒸馏对照在教师消融里是 95.3。4B 以下公开 VLA 多在 78.7%–95.3%。

RoboCasa-GR1 24 个 GR1 人形环境联合训练:48.2±2.1 升到 50.5±2.3,距同架构 4B 的 54.8% 还差 4.3 点。真机 30 次试验:

任务4B π 风格0.8B 未蒸馏0.8B 蒸馏
单臂水果93.383.393.3
单臂鸡蛋70.046.760.0
双臂交接53.340.046.7

失败几乎全是最后几厘米:提前松手、夹到筐沿、鸡蛋打滑。物体找得到,接触做不好。换学生尺度、骨干、对齐层、教师家族(Cosmos / Fast-WAM / V-JEPA2-AC)都有正向,LIBERO 上三名教师分别到 97.9、96.9、96.5。

为什么重要

想要世界模型的接地,不必在控制环里滚视频。一次离线缓存加一条余弦损失,部署延迟和显存与小 VLA 相同。0.8B 在 LIBERO 贴近更大模型,消费卡 32 毫秒、1.86 GB。这是便宜的表征先验,不是新架构。增益稳定但不大:仿真大约 2–3 个点。接触物理几乎帮不上,鸡蛋任务说明了这一点。对齐头只在训练期存在,所以任何增益都只能记在表征上,不能记在多出来的参数或测试时算力上。

局限与存疑

增益幅度有限,RoboCasa 跨 GPU 波动就有几个点,2.3 的提升和噪声同量级。论文没有单独的局限节,接触失败模式等于承认表征先验救不了力控。教师缓存仍要一次性算力。对齐的是池化图像特征,不是动作或未来帧,时序结构能继承多少是间接的。LIBERO 已近天花板,分数差很难翻译成真实鲁棒性。

术语

原文与代码

相关论文

全部论文解读