Dream4ACT 用统一视觉动作接口跨机器人本体建模,RoboTwin 2.0 成功率近 89%

Xiangyu Zhu · hf · 2026-10-05

视频生成模型为具身「观测—动作」建模提供了强时空先验,但关节空间动作向量缺乏图像空间结构,且不同机器人本体间维度与语义各异,难以直接复用。

论文提出 Dream4ACT,一个跨本体的联合视频—动作世界模型:

在 RoboTwin 2.0 上平均成功率 88.98%,TriWorldBench 总分 65.66,支持闭环操作与动作条件多视角预测。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →