SG-WAM:用视觉语言模型增强机器人动作模型的语言对齐

zhenjun_zhao · x · 2026-08-13

现有的世界-动作模型(WAM)在生成未来视频和动作时主要依赖视觉线索,导致生成的视频往往与语言指令在语义上不一致,降低了动作预测的准确性。本文提出了 SG-WAM 模型来解决这一限制。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →