清华 Simple-WAM:一次前向替代视频去噪,世界动作模型泛化两全其美
Tsinghua-LeapLab · hf · 2026-09-30
清华LeapLab团队研究世界动作模型(WAM)推理时是否还需要显式生成未来帧。
核心发现
- WAM 在训练中同时预测未来与动作,但视频去噪计算成本高:显式 WAM 推理时把未来去噪成干净帧,Latent WAM 则完全丢弃以加速。
- 实验显示 Latent WAM 在分布内任务上与显式版打平,却在环境扰动、数据效率、任务泛化三个维度上全面退化,失去 WAM 原本动机中的泛化收益。
- 分析表明差距几乎全部来自第一个去噪步:收益来自「为未来做准备」,而非真正生成未来。
Simple-WAM 方法
- 把未来建模简化为对完全加噪视频 token 的一次前向传播,并调整训练噪声 schedule 匹配该推理行为。
- 在仿真与真实任务上,Simple-WAM 泛化优于显式 WAM,推理效率与 Latent WAM 相当,兼得两者优势。
项目主页:zrporz.github.io/Simple-WAM-Web
「具身」频道最新
- IROS 2026 现可拥抱的人形机器人 Baymax 亮相 — CyberRobooo · 2026-09-30
- VLANeXt Family:500+ 控制实验提炼 12 条 VLA 模型实用配方 — ccloy · 2026-09-30
- 开源人形机器人 Roboparty 亮相 IROS,还能摸高达 — 4310sy · 2026-09-30
- Scoble 称 Google Glass 将回归:我们只是太早,而非方向错误 — Scobleizer · 2026-09-30
- DexAgent 从单个人类视频学双手灵巧操作,成功率达 63.6% — YunzhuLiYZ · 2026-09-30
- DexTaG:用人类触觉示教引导 RL,机器人学人类式用工具 — gan_chuang · 2026-09-30