深度跃迁发布 DELE-w0.5:弃用视频生成管线做机器人操作模型

jiqizhixin · x · 2026-09-13

深度跃迁(DeepLeap)发布机器人操作模型 DELE-w0.5。其核心论点是:基于视频生成的 world-action model 需要预测手臂运动、物体外观、光照变化等高维视觉内容才能输出低维动作序列,计算量巨大,而机器人操作的目标是预测动作执行后的世界状态,而非复现每一帧画面。DELE-w0.5 彻底放弃视频生成管线,训练时联合学习机器人动作、无需预测未来视觉轨迹,转而学习「目标条件下的行为重组」:当环境偏离训练轨迹时,机器人保持原任务目标并根据新状态调整动作。架构分三步:语言指令与当前观察 → VLM 任务规划 → 动作执行。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →