NVIDIA SANA-Video 2.0 用混合注意力实现单卡 720p 视频生成

nvidia · hf · 2026-07-24

NVIDIA 用混合注意力做视频生成,主打单卡高分辨率

NVIDIA 提出 SANA-Video 2.0,一个统一架构下的混合视频扩散 Transformer,提供 5B 和 14B 两个规模,目标是在 单 GPU 上生成最高 720p 的高质量视频。

核心做法是把 线性注意力 和周期性的 softmax anchor 结合起来:前者负责把计算成本压到近线性,后者补回纯线性注意力缺失的全局 token 交互;再配合 Block Attention Residuals (AttnRes) 把块级摘要传到后续层,提升深层表示能力。论文还强调这是 从头训练 的混合架构,而不是把已有模型线性化。

在结果上,NVIDIA 报告其 40-step 采样可达到 VBench 84.30,并在 单张 H100 上实现 480p 13.2 秒 推理;编译后的 forward 在 720p/60s 设定下比对应的全 softmax 基线快 3.2 倍,再加上 Sol-Engine 的 kernel fusion、缓存和稀疏注意力优化,总体又能再提速 3.58 倍。

所属事件:NVIDIA 发布 SANA-Video 2.0 高效视频生成模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →