VPP2 发布:14B 视频预测策略超越 Cosmos3-64B 11 个百分点
zhenjun_zhao · x · 2026-10-09
Video Prediction Policy 2(VPP2):更强的世界动作模型
- 问题:现有 WAM 在开放环境中常产生错误的运动预测,导致错误动作;归因于基础视频模型未针对操作优化、朴素加入动作模块会损害泛化。
- 方法:
- 构建大规模多样化操作视频数据集,带详细字幕做 event 级视频继续预训练;
- 后训练并蒸馏为单步视觉规划器,固定预测时域;
- 用 mixture-of-transformers(MoT)架构引入动作模块,学习隐式逆动力学模型。
- 结果:VPP2-14B 在开放环境零样本泛化上超越 Cosmos3-64B 达 11.0 个百分点,视频预测与动作生成都实现强零样本泛化。
「具身」频道最新
- PredActor 用单一扩散策略统一人形机器人运动生成与控制,G1 端侧跑 50Hz — carlosdponx · 2026-10-09
- Meta 智能眼镜美网广告走红,评论称手机或可留在口袋 — armand_ruiz · 2026-10-09
- 自动驾驶仿真新法:以风险百分位精确控制角落场景有多「角落」 — Jiaxi Liu · 2026-10-09
- 英特尔高管:企业机器人价值大头在存量装机,而非新销售 — ryanshrout · 2026-10-09
- IROS 2026 最佳论文:3D 特征直入 VLM,导航成功率升至 74.2% — qinzytech · 2026-10-09
- 沙特 Sirr 公司 Exobot 机器人定价 39.9 万里亚尔 — aziz4ai · 2026-10-09