Video DeltaNet 混合注意力加速视频生成,768p 视频去噪仅 6.7 秒
Haocheng Xi · hf · 2026-09-18
论文提出 Video DeltaNet(VDN),面向直播场景的视频生成,用视频原生混合注意力替代纯 softmax 注意力以突破计算瓶颈。
- 架构:局部 softmax 注意力 + 双向线性记忆负责长程视频上下文;线性分支引入 Video Delta Attention(VDA),每帧结合空间 token 更新一次记忆;独立输出投影与可学习门控校准两分支,通过分阶段教师对齐逐步引入预训练模型
- 实现:基于 MiniMax H3 实例化,视频到视频交互走混合注意力,文本/音频交互保留 softmax
- 性能:经八步蒸馏与优化过的 SGLang 服务栈,VDN-H3 在 8 张 NVIDIA B200 上完成 14.3 秒、768p 视频的 DiT 去噪仅用 6.70 秒,较 50 步 dense H3 基线加速 14.5 倍
「多模态」频道最新
- 用 AI 模型做国庆日动效:作者称已搭出专属工作流 — aziz4ai · 2026-09-18
- 判断依据来了:红果插广告,AI 短剧已被认定红海 — karminski3 · 2026-09-18
- Suno 改定价致历史下载变贵,用户转向开源替代 — Bedrovelsen · 2026-09-18
- Pika 支持按目标创作而非选模型,广告影片剪辑一站搞定 — minchoi · 2026-09-18
- 疑似 Qwen 新一代图像模型将至,Andrew Carr 预告又一篇爆款 — andrew_n_carr · 2026-09-18
- UFO 提出全条件对齐评测范式,与人类偏好相关性提升 15.25% — ustc-community · 2026-09-18