UniWAM:统一物理推理、世界生成与动作预测的机器人模型
zhenjun_zhao · x · 2026-10-02
arXiv 新论文提出 UniWAM(Unified World-Action Model),统一整合物理推理器、世界生成器与动作预测器,联合学习物理世界的语义理解、视觉生成与动作预测。
关键设计:
- 针对人类第一视角数据与机器人数据建立了严格的数据清洗与标注管线;
- 用自然语言表示低层动作,并为 VQA、人类第一视角、机器人演示三类数据分配互补监督,适配具身任务同时保留语言能力;
- 后训练阶段用未来视觉噪声增强降低对精确未来预测的依赖,历史条件化流匹配以编码的动作历史初始化动作生成,显著减少去噪步数且保持性能。
动机上,论文指出 VLA 模型缺乏世界动态 grounding,而世界-动作模型虽继承视频生成模型的时空先验,但在分布偏移下的语义理解与推理仍受限。
「具身」频道最新
- City Farmers 入选 OpenAI 首批 Codex Physical Builds,做室内种植智能体 — broodsugar · 2026-10-02
- 奥斯汀街头五辆车四台自动驾驶,Waymo 时代肉眼可见 — binarybits · 2026-10-02
- Tesla 数日内向德州车队新增 32 辆 Cybercab,无人驾驶出租车加速扩张 — binarybits · 2026-10-02
- EMPIRIC:让机器人用代码补全物理引擎缺失机制,5 个仿真域 25 关全通 — tomssilver · 2026-10-02
- Agility Digit 全身移动操作演示:IROS 连跑约 12 小时全自主 — chris_j_paxton · 2026-10-02
- 特斯拉 FSD 紧急刹停避险,邻车道司机却毫无反应 — xiaosun86 · 2026-10-02