NVIDIA 把稀疏 attention 融进一次 softmax,视频生成端到端提速最高 5.08 倍

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

cs.CV

2026-07-27

Sol-Attn 把稀疏 attention 的选块路由融进一次 online softmax,不重训就把视频生成端到端提速 2.1 到 3 倍,叠进 Sol-Engine 到 5.08 倍,质量不掉。

这篇在解决什么

视频扩散模型(Diffusion Transformer)生成长视频时,token 序列动辄几万到几十万,attention 的计算量随序列长度平方增长,成了推理最贵的环节。训练无关(training-free)的稀疏 attention 是最省事的提速办法:不重新训练,只在每一步挑出一部分 key-value 块来算,其余跳过。但现有方法在「怎么挑」上卡在两个地方。

第一,选块的路由(routing)既死板又费钱。top-k 给每个 query 固定选 k 个块,预算一刀切;top-p 一直选到累计概率达到某个阈值,预算是动态了却不均衡。更要紧的是,这两种都要先把整张「代理分数图」(proxy score map,衡量每个块重要性的分数表)算出来、存进显存,再开始稀疏计算,这趟来回在长序列上是不小的开销。第二,没选中的块直接丢弃,稀疏一激进,精度就掉。

方法

Sol-Attn(Sparsifying online attention)的出发点是一个观察:在预训练好的视频模型里,每个 query 对各 key 块的 pre-softmax 代理分数,分布近似正态。既然近似正态,选块就不必逐个排序,直接用一个阈值卡就行。

这个阈值是「按 query 动态算」的。对第 i 个 query,先统计它那一行代理分数的均值 μi 和标准差 σi,阈值就定在 τi = μi + βσi。β 是一个全局共享的标准化偏移,调它就能整体控制稀疏程度。这样每个 query 的预算会自适应,有的需要更多块、有的更少,但整体密度稳定可控,不像 top-p 那样忽大忽小。

真正的工程功夫,在把这个阈值判断融进一次 online softmax 的 kernel pass 里。三件事拧成一股:

把路由、稀疏计算、近似修正塞进同一个流式算子,是这篇在思路上的新东西:路由不再是稀疏 attention 之前的一个独立步骤,没选中的块也不再是丢掉,而是近似。

结果

主战场是文本到视频生成。在 LTX 2.3 上,密集 attention(FlashAttention-3)的 VBench 综合分 75.90,Sol-Attn 拿到 76.13,质量比密集还略高,同时端到端 2.02 倍提速。和其它稀疏方法横向比:

方法VBench↑端到端提速
FlashAttention-3(密集)75.901.00×
PISA76.031.86×
Sparse-VideoGen275.221.85×
XAttention73.901.61×
Sol-Attn76.132.02×

视频编辑(Bernini)上 Sol-Attn 2.34 倍,对 Sparse-VideoGen2 的 2.04 倍;一分钟长视频精修 3.04 倍对 2.08 倍。kernel 层面,在 H100 上高稀疏度时比 FlashAttention-3 快 11.5 到 32.7 倍,而 Sparse-VideoGen2 的路由结构要多占约 8 倍显存。

最具传播力的数字来自和 NVIDIA 自家推理框架 Sol-Engine 的叠加:核融合、扩散步缓存、Sol-Attn 三件套摞起来,在 B200 上对 Wan2.1-14B 端到端 3.48 倍,对 HunyuanVideo 5.08 倍。单跑 Sol-Attn 是 2.1 到 3.0 倍。

为什么重要

这是一个即插即用、训练无关的 kernel,跑 Wan、Hunyuan、LTX 这类视频模型的团队可以直接换上。视频生成推理贵,任何不重训就能拿两到三倍提速、质量还不掉的改动,都有实在价值。把路由融进 softmax、用近似代替丢弃这个设计,也不限于视频,对其他长序列扩散模型是可借鉴的思路。

局限与存疑

作者自己说了三条:当前 B200 kernel 还没把 Blackwell 的性能吃满;只支持前向推理,没有反向、不能拿去训练;评测只覆盖双向扩散类的视觉生成,没碰自回归视频生成。还有一个存疑点:几乎所有对比都在和其它训练无关稀疏方法比,没和需要轻量微调的方法正面较量,所以这是「训练无关」赛道内的领先,不等于整体最优。

术语

原文与代码

社区讨论

相关论文

全部论文解读