流式自回归视频模型架构解读
nathanbenaich · x · 2026-07-15
回复里提到,这个项目**不只是视频模型**,而是一个 **streaming autoregressive diffusion transformer**。 核心说明有两点: - 它是**逐帧顺序预测**的,试图缓解生成时误差累积的问题 - 它还是**可交互**的,可以通过文本提示词持续引导视频流 这说明它更像一个面向实时生成的多模态生成架构,而不是单次出片的静态视频模型。
「多模态」频道最新
- Grace Cathedral 做成了空地融合的互动 3D 扫描 — nptacek · 2026-07-21
- ReflectWorld-MM 把视频记忆按实体组织,在 6 项基准上拿到最好成绩 — Xiaokang Ma · 2026-07-21
- HOMIE 用多模态对齐提升人-物视频个性化生成 — Yiyang Cai · 2026-07-21
- Kling V3 仅凭一个提示词做出连续电影感长镜头 — umesh_ai · 2026-07-21
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- 昆仑万维发布 Matrix-Game 3.5,主打实时世界模型生成 — 智东西 · 2026-07-21