深度跃迁 DELE-w0.5:不生成视频的世界动作模型,真机成功率 62.5% 超 2 倍基线
机器之心 · wechat · 2026-09-04
深度跃迁发布世界动作模型 DELE-w0.5,展示「目标条件下的行为重组」:微波炉门被关上或只留缝隙时,机器人能重新开门或用手里的包装推门,在偏离训练轨迹的情况下仍保留任务目标并调整动作。
核心思路:视频式世界动作模型需联合预测动作与未来视觉轨迹,高维中间帧占用大量算力且拖慢控制循环。DELE-w0.5 改为联合预测「动作完成后的未来世界表征」——用 DINO-v3 对未来观察的 latent 编码表征物体位置与空间关系,不生成任何视频帧。训练时未来表征分支作监督,迫使策略学习结果导向的状态转移;推理时该分支被移除,控制链路更短,RTX 4090 上推理延迟中位数 87.5 毫秒。
真机结果(Astribot S1 双臂,4 项长程任务 × 8 种方法 × 各 20 次,共 640 次实验):
- 完整任务成功率 62.5%,约为最强基线 XR0(30.0%)的 2.1 倍
- 平均有序阶段进度 81.3%,最高基线 GWP0.5 为 61.3%
- 分任务:开门 80%、冰箱取可乐 65%、微波炉爆米花 60%、杯中加冰 45%,均第一
- 优势集中在任务后半程的状态保持与技能衔接;并展示跨桌面材质、光照、布局的 zero-shot 泛化
模型核心基座从底层自研,公司已完成由复兴创富独家投资的数千万元天使轮融资。团队认为对具身智能最有用的未来信息不是可观看的视频,而是足以约束行动的世界表征。
「具身」频道最新
- 波士顿动力 Atlas 实现“像素级”相机控制,支持鱼眼等非平面投影 — YunzhuLiYZ · 2026-09-04
- 马斯克预测:十年内全球人形机器人数量将达 10 亿台 — GooseberryGOLD · 2026-09-04
- 盲人父子乘 Cybercab 一小时,无人驾驶全程无干预 — Scobleizer · 2026-09-04
- 机器人学者 DennisHong:Physical AI 赢家属于进化最快者而非最好的机器人 — DennisHongRobot · 2026-09-04
- Sawyer Merritt 体验特斯拉 Cybercab 完整行程:称其改变游戏规则 — Scobleizer · 2026-09-04
- 拆解 Figure 全栈布局:GPU、数据、模型、制造闭环 — CyberRobooo · 2026-09-04