BAAI 团队 World Action Models:视频生成预测未来操控机器人

stepjamUK · x · 2026-09-15

北京通用人工智能研究院(BAAI)及合作团队提出 World Action Models(WAM):用视频生成模型为机器人「想象」接下来会发生什么,再据此决定动作,以此解决真实世界控制中「预测耗时、时间不够用」的矛盾。

关键发现在于去噪轮次与延迟的取舍:视频模型的预测要经过多轮去噪,每轮都给控制回路增加延迟,直觉上应压缩到一轮。但团队观察去噪过程后发现——场景背景几乎立刻就变清晰,而机械爪、目标物体及两者的交互关系直到多步之后才收敛。过早截断去噪,会得到清晰的房间画面却丢失关键的交互细节, quietly 破坏操控精度。这项工作解释了「为什么减少去噪步数会悄悄搞坏机器人控制」,对视频世界模型做机器人决策的延迟-精度权衡给出了实证依据。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →