将世界模型折叠进表征:具身控制推理延迟暴降 10 倍

Weili Zeng · hf · 2026-08-11

当前的视觉世界生成模型在用于机器人控制时,往往需要执行昂贵的生成分支来预测未来。该研究提出 Enfold 框架,核心思想是将世界模型构建未来的「生成计算过程」内部化,直接提炼为一种基于当前视觉和语言指令预测出的表征。

在训练阶段,模型利用生成器处理观测未来时暴露的多层级中间状态来监督编码器;而在部署推理时,动作预测不再需要执行生成器。在 LIBERO、RoboTwin2.0 及真实机器人任务上的实验表明,该方法在保持强控制能力的同时,相比 Fast-WAM 将动作延迟降低了 3.7 倍(Enfold-Flash 版本达 10.1 倍)。分析显示,该表征能有效抑制干扰变量并捕捉长程变化,且面对人类干预能自适应调整,而非机械重放固定轨迹。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →