Dream4ACT 用统一视觉动作接口跨机器人本体建模,RoboTwin 2.0 成功率近 89%
Xiangyu Zhu · hf · 2026-10-05
视频生成模型为具身「观测—动作」建模提供了强时空先验,但关节空间动作向量缺乏图像空间结构,且不同机器人本体间维度与语义各异,难以直接复用。
论文提出 Dream4ACT,一个跨本体的联合视频—动作世界模型:
- 引入共享视觉动作接口「action views」:基于 URDF 正向运动学,从 4 个预设虚拟相机渲染目标关节配置,统一各本体的动作表示,同时保留各自的铰接几何。
- 观测与动作序列共享同一视频自编码器和扩散 transformer;通过 masked flow-matching,单一模型支持正向动力学、逆动力学和联合观测—动作生成。
- 提出 training-free、URDF 约束的多视角恢复机制,无需为每个本体训练解码器即可从预测的 action views 还原可执行动作序列。
在 RoboTwin 2.0 上平均成功率 88.98%,TriWorldBench 总分 65.66,支持闭环操作与动作条件多视角预测。
「具身」频道最新
- 慕尼黑机器人公司 RobCo 九个月估值破 10 亿美元成独角兽 — lukas_m_ziegler · 2026-10-05
- 物理 AI 部署复盘会:evals、失败数据与再训练闭环 — carrycooldude · 2026-10-05
- Meta 发布 NAVA-WAM:纯视频预训练机器人动作策略,摆脱动作标注依赖 — meta · 2026-10-05
- 最受捧机器人模型百项真实操作任务只完成 7 项,演示剪掉其余 93 — carrycooldude · 2026-10-05
- Sergey Levine 深谈机器人:身体已够好,缺的是决策与数据飞轮 — 机器之心 · 2026-10-05
- 上海交大发布 LIFT:VLA 零力标注预训练,后训练注入力觉高频反应 — jiqizhixin · 2026-10-05