深度跃迁 DELE-w0.5:不生成视频的世界动作模型,真机成功率 62.5% 超 2 倍基线

机器之心 · wechat · 2026-09-04

深度跃迁发布世界动作模型 DELE-w0.5,展示「目标条件下的行为重组」:微波炉门被关上或只留缝隙时,机器人能重新开门或用手里的包装推门,在偏离训练轨迹的情况下仍保留任务目标并调整动作。

核心思路:视频式世界动作模型需联合预测动作与未来视觉轨迹,高维中间帧占用大量算力且拖慢控制循环。DELE-w0.5 改为联合预测「动作完成后的未来世界表征」——用 DINO-v3 对未来观察的 latent 编码表征物体位置与空间关系,不生成任何视频帧。训练时未来表征分支作监督,迫使策略学习结果导向的状态转移;推理时该分支被移除,控制链路更短,RTX 4090 上推理延迟中位数 87.5 毫秒。

真机结果(Astribot S1 双臂,4 项长程任务 × 8 种方法 × 各 20 次,共 640 次实验):

模型核心基座从底层自研,公司已完成由复兴创富独家投资的数千万元天使轮融资。团队认为对具身智能最有用的未来信息不是可观看的视频,而是足以约束行动的世界表征。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →