WorldDiT 统一动作生成与未来帧预测,做出机器人基线
bageldotcom · hf · 2026-07-28
WorldDiT 用统一扩散架构同时建模世界和动作
Bagel Labs 提出 WorldDiT:一个统一的 diffusion transformer,不再依赖大型预训练 VLM 作为动作骨干,而是让同一个模型同时生成连续动作块,并预测未来相机帧的归一化 RGB patch。
论文给出的核心结果是:
- 在 4 套 LIBERO 仿真基准 上评测
- 在“总参数量 vs. 平均成功率”的对比中,被作者称为处于 Pareto frontier
- 作为一个 10 亿参数以下 的基线,为后续扩展研究提供参考
「具身」频道最新
- NVIDIA 推出 Jetson 本地运行生成式 AI 的指南 — NVIDIAAI · 2026-07-28
- Meta 为 Ray-Ban Display 眼镜升级 Muse Spark,并接入 Threads — emmanuelvivier · 2026-07-28
- NVIDIA 称 Cosmos 模型在 Hugging Face 下载量已破 1000 万 — nvidia · 2026-07-28
- NVIDIA 称 Jetson 可装进包里,却能驱动机器人和边缘 AI — nordicinst · 2026-07-28
- Austin 正在成型为机器人重镇,UT Austin 和 Tesla 牵头 — lukas_m_ziegler · 2026-07-28
- 飞行雨伞原型靠无人机和深度感知跟随人移动 — kirbyman01 · 2026-07-28