北大团队提出 ViGAR:分层世界-动作模型让机器人长程操作成功率提升 12.86 点
DAGroup-PKU · hf · 2026-10-08
北大 DA 组提出 ViGAR,一种分层的「世界-动作模型」(WAM) 框架,面向真实机器人部署中的长程组合操作任务。
- 架构:将操作拆解为「视觉子目标规划器」+「子目标执行器」——规划器根据当前观测与全局指令预测下一子任务的视觉子目标,执行器再在该子目标条件下联合生成未来视觉轨迹与动作。两者共享预训练世界模型表征,共享物理知识。
- 上下文学习:给一张全局目标图像即可诱导不同的子任务分解与行为,无需参数更新。
- 成绩:RoboTwin Clean2Random benchmark 上 Clean/Random 设置分别达 82.00% 与 67.02% 成功率,平均超过最强基线 12.86 个百分点;5 个组合任务与 2 个上下文学习任务的真机实验进一步验证有效性。
「具身」频道最新
- Bulkhead 无人机电机设计概念曝光:月产能达 6 万台 — MatthewChang · 2026-10-08
- 港科大广州发布 UniWAM:统一物理推理、世界生成与动作预测,发现人机共训 scaling law — HKUSTGZ · 2026-10-08
- 开源 Agentic Workbench:能听会说能看的电子设备装配助手 — andreisavu · 2026-10-08
- RoboQuest 基准:最强多模态智能体具身探索成功率仅 23% — declare-lab · 2026-10-08
- RobotWorld 基准:84 个物理任务测试多模态机器人智能体 — Zhiqin Yang · 2026-10-08
- NVIDIA Long-WAM:扩展世界-动作模型上下文,动态堆杯成功率 95% — nvidia · 2026-10-08