北大清华阿里开源 SparkDiffusion:单卡 RTX 5090 视频生成加速 265 倍
机器之心 · wechat · 2026-09-28
北京大学、清华大学、阿里巴巴等机构发布 SparkDiffusion,首个将稀疏注意力、少步蒸馏与 FP8 量化整合到统一开源框架的 DiT 视频生成加速系统,已开源权重与完整训练代码。
- 核心发现「高稀疏陷阱」:稀疏率推到 97% 时,训练损失持续下降,视频质量却急剧恶化(人物破碎、时序混乱),延长训练也无法修复。Oracle 干预实验证明根因是高噪声阶段的结构误差会沿去噪轨迹被后续步骤放大。
- 解法:提出终端对齐监督(Terminal-Aligned Supervision),训练时直接约束每一步的最终生成结果;配合 RoLA 稀疏注意力模块(块稀疏+低秩线性分支补回全局信息)和 CrossDistill 轨迹混合蒸馏(高噪声用 PCM 保多样性、低噪声用 DMD 修终点误差),得到 3 步无 CFG 学生模型,再加 FP8 量化。
- 实测:RTX 5090 单卡 265 倍加速(720P-14B,18 秒生成 5 秒视频);H100 上 220 倍加速、延迟降至 8 秒;VBench-2.0 仅从 60.2 降到 59.77。
- 意义:分辨率越高加速收益越大(注意力 O(L²)),让消费级显卡也能高质量生成视频;框架支持 Wan2.1/2.2 的 T2V 与 I2V,后续将扩展至自回归视频生成与全模态生成。
「多模态」频道最新
- 开源视觉决策模型 Valen:单步决策仅122–128毫秒 — aigclink · 2026-09-28
- NotebookLM 秒出无脸视频,7 个实用提示词教程 — anthara_ai · 2026-09-28
- 一条提示词生成「电是什么」教学视频,Opus 5.5 砍掉制作门槛 — victor_explore · 2026-09-28
- 63 条 Claude Opus 动效视频精选,一周狂揽 1300 万播放 — tibo_maker · 2026-09-28
- GPT-6 Astra 演示:实拍视频一键变可训练机器人的 3D 世界 — 141_1337 · 2026-09-28
- Quantum Neon Origami 折纸风图像提示词模板分享 — LudovicCreator · 2026-09-28