DELE-w0.5: Inferring Action from Future Latent State for Robotic Manipulation
Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren
cs.RO, cs.AI, cs.CV, cs.LG
2026-08-23
深度跃迁提出DELE-w0.5,用未来潜在状态代替视频生成来出动作。640次真机试验全任务成功率62.5%,比最强基线高32.5个百分点,中位推理87.5ms。
近期一批World-Action Model(WAM,世界动作模型)把机器人控制架在视频生成骨干上:一边合成未来画面轨迹,一边出动作。视频先验能带进时空结构,但控制真正要的是动作执行之后世界变成什么样,中间那些过渡帧主要在描述「看起来怎么变」,维数高、吃显存,还把推理卡在多步去噪上。Flash-WAM、Efficient-WAM这类工作在减采样步数、稀疏token,没有改掉这个替代目标。
VLA(视觉-语言-动作模型)更直接,从当前观测映射到动作,但不强制模型表示动作的物理后果。深度跃迁这条技术报告想走第三条路:预测与动作因果相关的未来潜在状态,控制回路里不生成视频。
概率形式上,VLA估p(动作 | 观测, 本体感觉, 语言);视频WAM估p(动作, 整段未来视频 | …);DELE-w0.5估p(动作, 未来时刻的观测 | …),中间帧丢掉。
结构是双流Transformer。条件流用Qwen3编语言、DINOv3编三路相机(头显加双腕),投影到1024维,拼起来做单流注意力,再用AdaLN把条件写进QKV。噪声流对动作块和未来潜在状态做线性插值加噪,就是flow matching那套,同样出QKV。两流拼接后走带掩码的联合注意力,回归动作速度场和未来潜在状态速度场,总损失是La + λ Lo。
动作块长度H=60。单臂7维(相对位移、欧拉角、夹爪),双臂14维。
训练时的注意力掩码比口号更要紧。语言和当前观测互相可见,但不能看见动作或未来状态,避免目标泄漏进条件。动作可以看条件和自身,但不能看未来状态。未来状态可以看所有组,等于在学「指令+当前观测+动作 → 下一物理状态」。推理时未来状态token整组拿掉,模型只出动作。
所以部署时并没有「先生成未来状态、再据此解码动作」。未来状态是训练期的辅助目标,用来约束共享骨干去表征动作相关的世界变化。论文标题里的from future latent state,和这套掩码并不完全同一件事。
全部实验在同一台Astribot S1双臂机器人、固定真实场景上做。四个长程任务:开门、从冰箱取百事可乐、往杯子加冰、把爆米花放进微波炉并启动。每任务20次正式试验,8个方法共640次。每条rollout限180秒,中途无人协助,不安全即判失败。阶段必须按顺序完成,后面的动作补不了跳过的前置步骤。所有方法用同一套微调数据和三epoch等价训练。
| 方法 | 宏进度 | 全任务成功 |
| DELE-w0.5 | 81.3% | 62.5%(50/80) |
| GWP0.5 | 61.3% | 26.3% |
| XR0 | 59.5% | 30.0%(24/80) |
| π0.5 | 50.6% | 15.0% |
| GR00T-N1.7 | 22.0% | 0.0% |
按各指标最强基线算,全任务成功高32.5个百分点,宏进度高20.1个百分点。分任务成功率为开门16/20、取可乐13/20、加冰9/20、微波炉12/20。加冰最长,也最差。
RTX 4090上核心模型中位推理87.5 ms,不含网络、解码、IK和实机执行。成功rollout的平均完成时间:开门16.66 s,取可乐45.92 s,加冰46.27 s,微波炉39.50 s。
阶段保留图显示,多数基线卡在「技能切换时保住已完成状态」:开门会抓到把手但转推不同步;取可乐死在换手或关门;加冰死在舀冰和倾倒;微波炉能开门,插不进去或启动不了。DELE-w0.5更常走到后期,剩余失败仍集中在物体转交、精确释放和最终条件。
另外有两组未计入主表的干预试验:微波炉门被关上后,策略会保住袋子再开门;开口变窄时,会用手里的袋子把门推开,而不是回到演示里的拉手动作。作者把它写成目标条件下的行为重组,并声明这只是早期迹象,不是可量化的涌现。
如果结论站得住,视频生成就不必作为机器人WAM的默认中段。对要上真机、在意延迟的团队,87.5 ms的核心推理比「先合成视频再抽动作」更接近可部署。和π0.5、GWP0.5这些更重的生成头比,同样数据和epoch下成功率拉开一截。
但这篇更接近公司技术报告,不是消融完备的方法论文。收益可能来自未来状态辅助损失,也可能来自双流、DINOv3、动作块长度或数据质量。没有消融,没法把「丢掉视频」单因子拎出来复现。
推理期丢掉未来状态token,动作在训练时也看不见未来状态。联合训练有辅助目标,并不等于「从未来状态推断动作」。口号和掩码之间有缝。
实验只在一台机器人、固定场景、每任务20次。没有报告演示数量、λ、参数量、预训练数据。基线以VLA为主,GWP0.5是最接近的WAM,视频生成WAM的完整对照并不在表里。论文批评的是视频WAM的目标错配,实证赢的是VLA。
加冰成功率45%,长程误差累积仍在。所谓涌现只有定性描述。没有仿真基准,也没有光照、物体位置大幅扰动的泛化表。