WCM 给 VLA 机器人 RL 加上世界模型 critic
OpenMOSS-Team · hf · 2026-08-04
WCM 给 VLA 机器人强化学习加上“世界模型式”critic
OpenMOSS 提出 WCM(World Critic Model),用于 Vision-Language-Action 模型的强化学习后训练。作者认为,现有很多 critic 只看单帧观测或单帧 backbone latent,这和机器人控制的部分可观测性天然不匹配。
方法
- WCM 采用轻量级的 LeJEPA 风格架构。
- 它同时预测未来 latent state 并估计价值,让 critic 学到时间动态,而不只是回归一个标量回报。
- 该方法可接入 on-policy 和 off-policy 两类训练管线。
- 可兼容 Pi0、Pi0.5 和 OpenVLA-OFT 等 backbone。
结果
- 实验覆盖 4 个 benchmark 的 149 个任务。
- 论文称其在 in-distribution 与 out-of-distribution 设置下都稳定达到 SOTA。
- 还在 7 个真实世界操作任务 上做了验证,说明方案可以较稳地落地到不同环境。
「具身」频道最新
- 类视网膜光流传感器把运动计算直接放进芯片 — ssh4net · 2026-08-04
- Figure 说人形机器人供应链只能自己从零搭建 — adcock_brett · 2026-08-04
- DARPA lift challenge 里燃气双旋翼对上 32 桨电动机型 — GoddenThomas · 2026-08-04
- Blue River 创始人:机器人得能真正用起来才算数 — davidyin44 · 2026-08-04
- 视频生成可把一套 SOP 拍成多语培训与巡检数据 — xiaohu · 2026-08-04
- 合成视频可生成车间违规样本与机械臂训练片段 — xiaohu · 2026-08-04