WCM 给机器人 RL 的 critic 装上世界模型,π₀ 在 ManiSkill 涨 46 分

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

cs.RO, cs.CL, cs.CV

2026-08-01

WCM 给机器人 RL 的 critic 加一个预测未来的头,逼价值表示学会时间动态;π₀ 在 ManiSkill 涨到 84.4,OpenVLA-OFT 零样本从 0.8 冲到 98.7。

这篇在解决什么

用强化学习后训练视觉-语言-动作(VLA)模型,是现在机器人操作的主流路线之一,而 RL 离不开一个 critic(价值函数)来估计每步的好坏。问题是,现有 critic 基本只看当前这一帧观察,或者只取 VLM 主干的单帧隐状态。机器操作是个部分可观测的过程:手有没有碰到物体、接触进展到哪一步、接下来会怎么动,这些都藏在时间序列里,单帧根本看不出。简单地把几帧堆在一起也不行,因为标量回报这种弱监督逼不出跨时间的动态表示。WCM 要修的就是这个 critic。

方法

WCM 建在一个轻量的 LeJEPA 式结构上,核心是让 critic 在估计价值之外同时预测未来,把时间动态逼进表示里。

关键设计点是联合优化:不是先训好一个世界模型再接 critic,而是让预测未来和估值共享同一个表示主干,逼它真正学会环境怎么随时间演化,而不是只回归一个标量。WCM 既能 on-policy 用(自回归模型如 OpenVLA-OFT 配 PPO,流匹配模型如 π₀/π₀.₅ 配 Flow-SDE),也能 off-policy 用(分别配 AWR 和 RECAP,统一数据缓冲区混合 SFT 数据和 rollout)。

结果

ManiSkill 上(IND 和 OOD 两种设置,Δ 是相对 SFT 基线的提升):

主干方法INDOOD
π₀SFT38.418.1
π₀+FlowSDE78.839.3
π₀+WCM84.451.5
π₀.₅+WCM91.964.4
OpenVLA-OFT+PPO97.777.1
OpenVLA-OFT+WCM99.077.9

最显眼的是 OpenVLA-OFT 的 zero-shot 迁移:不经 SFT 直接上 WCM,IND 从 0.8 冲到 98.7。LIBERO-Plus 泛化上,π₀ 从只看一条 demo 的 One-SFT(32.3%)涨到 +WCM 的 72.8%,比看 50 条 demo 的 Full-SFT(71.2%)还高;三个主干都类似,提升 +33.7 到 +44.7 个百分点。真机(WidowX-250S)上,WCM 比各自的 off-policy 基线(AWR / RECAP)在 7 个任务里全面领先,比如 π₀.₅ 加 WCM 抓胡萝卜 44/50 对 33/50。

为什么重要

对做机器人 RL 的人,WCM 给了一个具体且不贵的改进点:critic 不必只看单帧,加一个预测未来的头就能把时间信息吃进来,而且 on/off-policy 都能用、自回归和流匹配两类 VLA 都适配。LIBERO-Plus 上「一条 demo 加 WCM 超过 50 条 demo 的 Full-SFT」说明它把样本效率拉了上来。这个思路(让价值表示承担世界建模义务)也容易迁移到其他带 critic 的 RL 场景。

局限与存疑

作者自己列了几条:历史长度 K=3 最优,再长收益有限(他们的解释是 3 帧隐含二阶动态即加速度,2 帧只能抓一阶即速度);λ 这个权衡预测和估值的超参对 OOD 很敏感(波动 10.6 个百分点,IND 只 2.7),得小心调;真机要几百到上千条轨迹,仿真 SFT 用 16800 条样本直接上真机是 0% 成功,仿真到真机的 gap 依然在。通读下来还有一点疑问:zero-shot 那组 0.8 到 98.7 跨度极大,值得在更多任务上确认不是 ManiSkill 单一分布的特殊情况。

术语

原文与代码

社区讨论

相关论文

全部论文解读