将世界模型折叠进表征:具身控制推理延迟暴降 10 倍
Weili Zeng · hf · 2026-08-11
当前的视觉世界生成模型在用于机器人控制时,往往需要执行昂贵的生成分支来预测未来。该研究提出 Enfold 框架,核心思想是将世界模型构建未来的「生成计算过程」内部化,直接提炼为一种基于当前视觉和语言指令预测出的表征。
在训练阶段,模型利用生成器处理观测未来时暴露的多层级中间状态来监督编码器;而在部署推理时,动作预测不再需要执行生成器。在 LIBERO、RoboTwin2.0 及真实机器人任务上的实验表明,该方法在保持强控制能力的同时,相比 Fast-WAM 将动作延迟降低了 3.7 倍(Enfold-Flash 版本达 10.1 倍)。分析显示,该表征能有效抑制干扰变量并捕捉长程变化,且面对人类干预能自适应调整,而非机械重放固定轨迹。
「具身」频道最新
- Dyna Robotics发布Dyna-2:百万小时人类视频预训练 — JasonMa2020 · 2026-08-11
- 论文速递:增强视觉表征的双分支VIO框架 — rsasaki0109 · 2026-08-11
- 中国机器人公司化身VC:29家初创完成125笔投资 — FinanceYF5 · 2026-08-11
- 具身智能公司化身VC:29家企业累计投资125笔 — FinanceYF5 · 2026-08-11
- Galaxy Z Fold 8上手:轻如护照,单手易用,苹果落后了? — bilawalsidhu · 2026-08-11
- Mistral 进军机器人:推视觉导航新研究,刷新 R2RCE 评测 SOTA — sivareddyg · 2026-08-11