SANA-Video 2.0 用混合注意力拿下 84.30 分并大幅提速
danijarh · x · 2026-07-24
SANA-Video 2.0 是一款主打效率的视频生成模型,同时强调画质不缩水。
团队给出的关键技术点包括:混合线性-Softmax 注意力、Block Attention Residuals,以及自研的 Sol-Engine 加速栈。训练方面,他们称在资源很有限的情况下,从头训练了统一的 5B 和 14B 两个版本:5B 只用了 16 个 H100 节点,14B 用了 48 个 B200 节点。
官方公布的结果包括:
- 84.30 VBench Total
- 720p/60s 场景下,DiT 前向比匹配的 full-softmax 版本快 3.2×
- 单张 H100 上生成 720p/5s 用时 13.06 秒
- 在相同单 H100 设置下,比 Wan 2.2-A14B 快 120×
这条帖子的核心信息是:高质量 720p 视频生成可以通过更激进的结构与系统优化,在更少资源下做得更快。
「多模态」频道最新
- Midjourney 提示词把 70 年代复古和机械信息图混在一起 — michaelrabone · 2026-07-24
- 一份 GPT image 2 提示词模板,把 ChatGPT 变成水彩肖像机 — SimplyAnnisa · 2026-07-24
- 生成式 AI 的真正变化,是从一次性提示转向对话式工作流 — LawfulnessNext3503 · 2026-07-24
- FLUX 3 Video 开放早期体验,但生产化关键数据仍缺失 — MembershipEmergency7 · 2026-07-24
- Nova Crew 科幻短片:飞船掠过行星的电影感画面 — HomeRemedyHealer · 2026-07-24
- ListenHub 和 Labnana 上线 Seedream 5.0 Pro 图像编辑 — oran_ge · 2026-07-24