WorldDiT 统一动作生成与未来帧预测,做出机器人基线

bageldotcom · hf · 2026-07-28

WorldDiT 用统一扩散架构同时建模世界和动作

Bagel Labs 提出 WorldDiT:一个统一的 diffusion transformer,不再依赖大型预训练 VLM 作为动作骨干,而是让同一个模型同时生成连续动作块,并预测未来相机帧的归一化 RGB patch。

论文给出的核心结果是:

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →