SG-WAM:用视觉语言模型增强机器人动作模型的语言对齐
zhenjun_zhao · x · 2026-08-13
现有的世界-动作模型(WAM)在生成未来视频和动作时主要依赖视觉线索,导致生成的视频往往与语言指令在语义上不一致,降低了动作预测的准确性。本文提出了 SG-WAM 模型来解决这一限制。
- VLM 语义规划器:引入视觉语言模型(VLM)作为语义规划器,增强 WAM 的指令锚定能力。
- 语义前瞻:训练该规划器预测文本锚定和空间感知的语义前瞻。文本锚定前瞻通过识别正确目标物体来锚定指令,空间感知前瞻则为精确操作提供场景几何信息。
- 特征注入:将这种前瞻作为高级语义指导注入 WAM 中,确保未来视频生成和动作预测都能忠实地遵循语言指令。仿真和真实世界实验均证实了其优越性。
「具身」频道最新
- VLAIRobotics 发布双臂人形机器人 K1,起售价 1.98 万元 — AI寒武纪 · 2026-08-13
- Dyna-2模型基于百万小时人类视频预训练,实现机器人跨实体能力迁移 — iamfakhrealam · 2026-08-13
- 丹麦研发无关节仿蚯蚓软体机器人,抗挤压适用于搜救场景 — lukas_m_ziegler · 2026-08-13
- SHAPER:免训练实现具身智能体技能进化 — Peidong Wang · 2026-08-13
- 专家谈机器人形态:人形机器人或成万亿美元市场,但非唯一答案 — MarwaEldiwiny · 2026-08-13
- Minimax H3 在 RTX 5060 Ti 上跑视频生成:25秒出片 — Beginning_Tip300 · 2026-08-13