苹果发布 STARFlow-V:首个基于归一化流的因果视频生成模型
thoma_gu · x · 2026-09-01
Apple 团队发布 STARFlow-V,首个基于归一化流(Normalizing Flow)的因果视频生成模型,证明不靠 diffusion 也能在视觉质量上匹敌视频扩散模型。
核心设计:
- 在时空潜空间采用全局-局部架构,把因果依赖限制在全局潜空间、保留帧内丰富的局部交互,缓解自回归生成中常见的误差累积;
- 提出 flow-score matching,为模型加一个轻量因果去噪器以提升自回归生成的一致性;
- 引入视频感知的 Jacobi 迭代方案,把内部更新并行化而不破坏因果性,提升采样效率;
- 得益于可逆结构,同一模型原生支持 T2V/I2V/V2V 多任务,且支持端到端训练与精确似然估计。
背景是近期讨论「多数『自回归视频』其实是双向短片段 DiT 加因果掩码蒸馏」的声音,本文给出了另一条路线。论文与代码已公开。
「多模态」频道最新
- 开发者更新实时面部增强应用:面部肌肉动画系统明显改进 — Many-Ad-6225 · 2026-09-03
- FastH3 开放 API:720p 实时流式视频+同步音频,超实时速度且出奇便宜 — boudaboy · 2026-09-03
- 多款 AI 检测器判一首歌 80% 为 AI,博主难以置信 — BountyKraken · 2026-09-03
- 用 Imagine agent 逐镜生成+网格拼贴,调色实验工作流分享 — Kyrannio · 2026-09-03
- Video Delta Net 让开源视频生成提速 75–90 倍,14 秒视频 11 秒生成 — xiuyu_l · 2026-09-03
- Vine 复活:用 fal H3 Max Turbo 生成的无限滑动短视频流 — chrisfirst · 2026-09-03