SANA-Video 2.0 用混合注意力拿下 84.30 分并大幅提速
danijarh · x · 2026-07-24
SANA-Video 2.0 是一款主打效率的视频生成模型,同时强调画质不缩水。
团队给出的关键技术点包括:混合线性-Softmax 注意力、Block Attention Residuals,以及自研的 Sol-Engine 加速栈。训练方面,他们称在资源很有限的情况下,从头训练了统一的 5B 和 14B 两个版本:5B 只用了 16 个 H100 节点,14B 用了 48 个 B200 节点。
官方公布的结果包括:
- 84.30 VBench Total
- 720p/60s 场景下,DiT 前向比匹配的 full-softmax 版本快 3.2×
- 单张 H100 上生成 720p/5s 用时 13.06 秒
- 在相同单 H100 设置下,比 Wan 2.2-A14B 快 120×
这条帖子的核心信息是:高质量 720p 视频生成可以通过更激进的结构与系统优化,在更少资源下做得更快。
所属事件:NVIDIA 发布 SANA-Video 2.0 高效视频生成模型(2 条相关)→
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11