BAAI 团队 World Action Models:视频生成预测未来操控机器人
stepjamUK · x · 2026-09-15
北京通用人工智能研究院(BAAI)及合作团队提出 World Action Models(WAM):用视频生成模型为机器人「想象」接下来会发生什么,再据此决定动作,以此解决真实世界控制中「预测耗时、时间不够用」的矛盾。
关键发现在于去噪轮次与延迟的取舍:视频模型的预测要经过多轮去噪,每轮都给控制回路增加延迟,直觉上应压缩到一轮。但团队观察去噪过程后发现——场景背景几乎立刻就变清晰,而机械爪、目标物体及两者的交互关系直到多步之后才收敛。过早截断去噪,会得到清晰的房间画面却丢失关键的交互细节, quietly 破坏操控精度。这项工作解释了「为什么减少去噪步数会悄悄搞坏机器人控制」,对视频世界模型做机器人决策的延迟-精度权衡给出了实证依据。
「具身」频道最新
- Verne Robotics 押注端侧推理:机器人不靠 WiFi 跑策略 — danfei_xu · 2026-09-15
- 机器人基础模型或成安全关键:理解世界才谈得上安全 — chris_j_paxton · 2026-09-15
- Moonphase Flip:手机背面的低干扰 AI 待办屏幕 — future_coded · 2026-09-15
- 让模型操控真实机械臂画金门大桥,实验被 MuJoCo 复现并开源 — victormustar · 2026-09-15
- Reimagine Robotics 构建「客户在职教机器人」的未来 — notmisha · 2026-09-15
- SimpliSafe 新款 AI 门铃上线:$199.99 外加真人保安盯梢 — The Verge AI · 2026-09-15