AlayaWorld 把交互式长时程世界模型做到 24 帧视频生成
AlayaLab · hf · 2026-07-22
AlayaLab 发布 AlayaWorld,一套交互式长时程视频世界模型,主打从文本、图片或视频出发,生成可探索、持续演化的虚拟环境。
它能做什么
- 生成 24fps、540p/720p 的视频。
- 基于一个 15B 参数的视频 diffusion transformer。
- 在相机轨迹和可切换文本提示下,按短 latent chunk 自回归生成。
稳定性怎么做
- 通过 persistent sink frame、压缩的时间历史、几何对齐的空间记忆和最近帧条件一起维持长程一致性。
- 用来自自身 rollout 的 corrupted histories 和 prediction residuals 训练,降低长期漂移。
- 还引入离散自回归蒸馏,把每个 chunk 的推理步数从大约 30 步降到 4 步。
结果
- 在 iWorld-Bench 上拿到长时程生成的最佳表现。
- 作者把它定位为一个开源、可扩展的交互式视频世界模型底座。
所属事件:AlayaWorld开源支持镜头控制的视频世界模型(3 条相关)→
「多模态」频道最新
- Seedance 2.0 把奇幻提示词做成电影感骑手视频 — umesh_ai · 2026-07-22
- 有人把最早创世神话做成了视频项目 — impreprex · 2026-07-22
- Krea 2 的镶嵌图案,用简化提示词终于做对了 — NatalieCrypto · 2026-07-22
- 马斯克称 Grok Imagine 可在 15 秒内展示时尚视觉效果 — elonmusk · 2026-07-22
- Kling 的运动控制演示,视频效果明显升级 — neo_truthseeker · 2026-07-22
- Alexander Kiesel 的《Thousand Doors》像电影一样的 AI 视频作品 — Aggressive_Log_9676 · 2026-07-22