CSWAM 论文引入 V-JEPA 2.1 因果语义专家,提升世界动作模型分布外泛化
zhenjun_zhao · x · 2026-10-01
论文提出 CSWAM(Causal Semantic World Action Model),针对 FastWAM 类世界动作模型在视觉分布偏移下泛化差的问题:
- 问题诊断:action-only 推理虽高效,但其面向重建的表征过度依赖外观细节,难以泛化到未见场景与物体;且缺乏观测历史,无法可靠识别任务相关的状态变化与运动。
- 方法:在 FastWAM 上增建一个基于 V-JEPA 2.1 的因果语义专家。V-JEPA 提供时间上有根据的语义状态变化与运动表征,降低对外观细节的依赖;专家从当前与过去观测的稀疏历史学习其未来演化,并通过因果注意力把历史上下文共享给视频流和动作流。
- 推理:动作去噪以当前视频状态与观测到的语义历史为条件,同时保留高效的 action-only 推理。
- 实验:在仿真与真实机器人上评估分布偏移下的泛化,具身预训练后 CSWAM 提升了泛化表现。
「具身」频道最新
- Boston Dynamics 机械手设计获赞,三指方案或已够用 — MarwaEldiwiny · 2026-10-01
- 机器人触觉新突破:手指与手掌全覆盖式触觉感知演示 — CyberRobooo · 2026-10-01
- LATENT 用不完美人类动数据教会人形机器人打网球对拉 — chris_j_paxton · 2026-10-01
- 被赞最 dynamic 的 EngineAI T800,却在 IROS 摔得最多 — chris_j_paxton · 2026-10-01
- 复古硬件自制正在兴起,AI 硬件设计打开新世界 — pvncher · 2026-10-01
- 机器人专家驳斥 Figure 销毁 F.02 的 IP 说法:营销拙劣且站不住脚 — MarwaEldiwiny · 2026-10-01