4D-WAM:将 3D 轨迹场时空感知注入机器人动作模型
zhenjun_zhao · x · 2026-08-13
世界-动作模型(WAM)通常在 2D 像素空间中表示视频,这与执行机器人动作的 3D 空间存在表示鸿沟。现有的 3D 方法未能充分利用 3D 结构的动态特性。本文提出了 4D-WAM,一种模型无关的训练策略。
- 核心方法:通过表示对齐,将来自 3D 轨迹场的时空知识注入 WAM 中。
- 双重对齐目标:1) 运动对齐:对齐相邻帧间的时序特征变化,鼓励模型在训练期间建立局部 4D 感知;2) 目的地对齐:通过最小化源帧与最终目的地之间的注意力相似度分布差距,引导模型推断最终目标。
- 实验结果:这些目标提供了局部运动监督和长期目标指导,使 WAM 能够学习轨迹级别的时空表示,在分布内和分布外实验中均表现出色。
「具身」频道最新
- VLAIRobotics 发布双臂人形机器人 K1,起售价 1.98 万元 — AI寒武纪 · 2026-08-13
- Dyna-2模型基于百万小时人类视频预训练,实现机器人跨实体能力迁移 — iamfakhrealam · 2026-08-13
- 丹麦研发无关节仿蚯蚓软体机器人,抗挤压适用于搜救场景 — lukas_m_ziegler · 2026-08-13
- SHAPER:免训练实现具身智能体技能进化 — Peidong Wang · 2026-08-13
- 专家谈机器人形态:人形机器人或成万亿美元市场,但非唯一答案 — MarwaEldiwiny · 2026-08-13
- Minimax H3 在 RTX 5060 Ti 上跑视频生成:25秒出片 — Beginning_Tip300 · 2026-08-13