公开数据 16 卡训 VLAct,未见人形 20% 数据超过全量 GR00T

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu, Mingkang Zhu, Pengguang Chen, Shu Liu, Zhuotao Tian, Hengshuang Zhao, Bei Yu, Jiaya Jia

cs.RO, cs.CV

2026-08-28

冻结浅层、多连续动作头共监督、部分统一跨本体动作空间,把有限机器人轨迹炼成可迁移表征。LIBERO-Plus 82.6%,RoboTwin 2.0 清洁集 92.5%。未见过的 GR-1 上 20% 数据到 49.5%,超过全量 GR00T-N1.6 的 47.6%。

这篇在解决什么

机器人轨迹不能像图文那样从网上刮。采集贵,对场景、物体、任务、本体的覆盖天生稀疏。继续预训练如果只是在这份稀疏数据上把动作拟合好,骨干网很容易发生三件事:视觉语言先验被窄场景冲掉;单一动作头把特征几何锁死在自己的解码方向上;各本体各用一个头,夹爪开合同样的语义也对不齐。

VLAct 把问题从「再多采集」转成「固定数据预算下,继续预训练该怎样塑造可迁移的视觉-动作表征」。下游微调时动作头重新初始化,骨干权重是唯一变量。

方法

起点是 Qwen3-VL-4B,在 DROID、InternA1、RoboCoin、MolmoAct 等公开轨迹上继续预训练,16 卡。继续预训练阶段做三件事,微调时全部丢掉预训练头和 caption 支路。

视觉语言先验靠两招保住:冻结视觉编码器和 LLM 下半层,只更新上层和动作头;混入 caption,因为消融里 caption 对下游的锚定最强。浅层保护在 LIBERO-Plus 上贡献约 3.7 个点,Agilex 上约 3.4 个点。微调再解冻全网。

动作表征用 OFT、PI、GR00T 三个连续头共监督。预实验里 FAST 离散头能往连续头转移,但粒度不够;OFT 单头预训练同头微调很强,换 PI 掉 5.4 个点,换 GR00T 掉 22.3 个点。多头是为了不让骨干锁进某一个解码几何。

跨本体用一个共享头、部分统一的动作布局:夹爪开合共享,运动学对不齐的臂关节保持本体专用并在失活维上掩码。周期关节用模 360° 的 wrap-aware 损失,避免 179° 和 -179° 被当成差 358°。

结果

LIBERO-Plus 在标准 LIBERO 上训练、扰动测试集上评:

方法CameraRobotNoiseLayoutTotal
π013.86.079.068.853.6
Abot-M060.467.986.482.680.5
Qwen3VL-OFT47.060.173.179.275.0
VLAct73.968.486.083.382.6

相对同骨干的 OFT 微调高 7.6 个点,相对阿里 Abot-M0 高 2.1 个点,Camera 上从 47.0 拉到 73.9。

RoboTwin 2.0 的 Data Scaling 清洁集上,VLAct-OFT 92.5%、随机 90.8%,PI 头清洁集 93.0%。Base 设定只用每任务 50 条清洁轨迹,VLAct-OFT 清洁 80.5%、随机 41.5%,对照 Qwen3VL-OFT 的 61.7% / 10.5%。真机 Franka 上,短程 ID 平均 92.5% 对基线 77.5%,双臂协调 72.0% 对 44.0%,长程 OOD 全替换物体仍有 83.3%,基线 46.6%。

继续预训练只见过 Franka 单臂和 AgileX 双臂。未见过的 GR-1 人形上,20% 下游数据 49.5%,50% 到 51.0%,全量 54.0%;全量 GR00T-N1.6 是 47.6%,同骨干无此预训练是 48.8%,π0.5 是 37.0%。RoboDojo 35 个策略里成功率排第六(7.60%),平均分第十档里的 10.66,高于所有点名的 world-action model;Memory 一项只有 0.66 / 0.56%,是短板。

为什么重要

对比协议把动作头、数据、优化器和步数对齐,只换骨干,7.6 到 21.4 个点的差距可以记在表征菜谱上,不该记在「换了个更强的头」上。对没有闭源轨迹、只有十几张卡的团队,这是一条能打工业系统的公开数据路线。

它没有否定规模。它说规模不够用的时候,怎么用现有轨迹塑造骨干是另一条独立轴。真机和未见本体上的迁移,比再刷一个饱和仿真榜更有信息量。

局限与存疑

资源限制下只做了 4B,更大 VLM 的最优冻结层数和混数比可能不同。RoboDojo 的 Memory 几乎没分,表征菜谱显然没有解决回合记忆。榜单不归一化训练算力,前排大量工业提交,名次只能当参照。预训练头在微调时丢掉,用户仍要为新本体选头并准备下游数据,20% 不是零样本。真机每项 10 次试验,区间会宽。

术语

原文与代码

社区讨论

相关论文

全部论文解读