WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu
cs.RO, cs.CL, cs.CV
2026-08-01
WCM 给机器人 RL 的 critic 加一个预测未来的头,逼价值表示学会时间动态;π₀ 在 ManiSkill 涨到 84.4,OpenVLA-OFT 零样本从 0.8 冲到 98.7。
用强化学习后训练视觉-语言-动作(VLA)模型,是现在机器人操作的主流路线之一,而 RL 离不开一个 critic(价值函数)来估计每步的好坏。问题是,现有 critic 基本只看当前这一帧观察,或者只取 VLM 主干的单帧隐状态。机器操作是个部分可观测的过程:手有没有碰到物体、接触进展到哪一步、接下来会怎么动,这些都藏在时间序列里,单帧根本看不出。简单地把几帧堆在一起也不行,因为标量回报这种弱监督逼不出跨时间的动态表示。WCM 要修的就是这个 critic。
WCM 建在一个轻量的 LeJEPA 式结构上,核心是让 critic 在估计价值之外同时预测未来,把时间动态逼进表示里。
关键设计点是联合优化:不是先训好一个世界模型再接 critic,而是让预测未来和估值共享同一个表示主干,逼它真正学会环境怎么随时间演化,而不是只回归一个标量。WCM 既能 on-policy 用(自回归模型如 OpenVLA-OFT 配 PPO,流匹配模型如 π₀/π₀.₅ 配 Flow-SDE),也能 off-policy 用(分别配 AWR 和 RECAP,统一数据缓冲区混合 SFT 数据和 rollout)。
ManiSkill 上(IND 和 OOD 两种设置,Δ 是相对 SFT 基线的提升):
| 主干 | 方法 | IND | OOD |
| π₀ | SFT | 38.4 | 18.1 |
| π₀ | +FlowSDE | 78.8 | 39.3 |
| π₀ | +WCM | 84.4 | 51.5 |
| π₀.₅ | +WCM | 91.9 | 64.4 |
| OpenVLA-OFT | +PPO | 97.7 | 77.1 |
| OpenVLA-OFT | +WCM | 99.0 | 77.9 |
最显眼的是 OpenVLA-OFT 的 zero-shot 迁移:不经 SFT 直接上 WCM,IND 从 0.8 冲到 98.7。LIBERO-Plus 泛化上,π₀ 从只看一条 demo 的 One-SFT(32.3%)涨到 +WCM 的 72.8%,比看 50 条 demo 的 Full-SFT(71.2%)还高;三个主干都类似,提升 +33.7 到 +44.7 个百分点。真机(WidowX-250S)上,WCM 比各自的 off-policy 基线(AWR / RECAP)在 7 个任务里全面领先,比如 π₀.₅ 加 WCM 抓胡萝卜 44/50 对 33/50。
对做机器人 RL 的人,WCM 给了一个具体且不贵的改进点:critic 不必只看单帧,加一个预测未来的头就能把时间信息吃进来,而且 on/off-policy 都能用、自回归和流匹配两类 VLA 都适配。LIBERO-Plus 上「一条 demo 加 WCM 超过 50 条 demo 的 Full-SFT」说明它把样本效率拉了上来。这个思路(让价值表示承担世界建模义务)也容易迁移到其他带 critic 的 RL 场景。
作者自己列了几条:历史长度 K=3 最优,再长收益有限(他们的解释是 3 帧隐含二阶动态即加速度,2 帧只能抓一阶即速度);λ 这个权衡预测和估值的超参对 OOD 很敏感(波动 10.6 个百分点,IND 只 2.7),得小心调;真机要几百到上千条轨迹,仿真 SFT 用 16800 条样本直接上真机是 0% 成功,仿真到真机的 gap 依然在。通读下来还有一点疑问:zero-shot 那组 0.8 到 98.7 跨度极大,值得在更多任务上确认不是 ManiSkill 单一分布的特殊情况。