Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han
cs.CV
2026-07-27
Sol-Attn 把稀疏 attention 的选块路由融进一次 online softmax,不重训就把视频生成端到端提速 2.1 到 3 倍,叠进 Sol-Engine 到 5.08 倍,质量不掉。
视频扩散模型(Diffusion Transformer)生成长视频时,token 序列动辄几万到几十万,attention 的计算量随序列长度平方增长,成了推理最贵的环节。训练无关(training-free)的稀疏 attention 是最省事的提速办法:不重新训练,只在每一步挑出一部分 key-value 块来算,其余跳过。但现有方法在「怎么挑」上卡在两个地方。
第一,选块的路由(routing)既死板又费钱。top-k 给每个 query 固定选 k 个块,预算一刀切;top-p 一直选到累计概率达到某个阈值,预算是动态了却不均衡。更要紧的是,这两种都要先把整张「代理分数图」(proxy score map,衡量每个块重要性的分数表)算出来、存进显存,再开始稀疏计算,这趟来回在长序列上是不小的开销。第二,没选中的块直接丢弃,稀疏一激进,精度就掉。
Sol-Attn(Sparsifying online attention)的出发点是一个观察:在预训练好的视频模型里,每个 query 对各 key 块的 pre-softmax 代理分数,分布近似正态。既然近似正态,选块就不必逐个排序,直接用一个阈值卡就行。
这个阈值是「按 query 动态算」的。对第 i 个 query,先统计它那一行代理分数的均值 μi 和标准差 σi,阈值就定在 τi = μi + βσi。β 是一个全局共享的标准化偏移,调它就能整体控制稀疏程度。这样每个 query 的预算会自适应,有的需要更多块、有的更少,但整体密度稳定可控,不像 top-p 那样忽大忽小。
真正的工程功夫,在把这个阈值判断融进一次 online softmax 的 kernel pass 里。三件事拧成一股:
把路由、稀疏计算、近似修正塞进同一个流式算子,是这篇在思路上的新东西:路由不再是稀疏 attention 之前的一个独立步骤,没选中的块也不再是丢掉,而是近似。
主战场是文本到视频生成。在 LTX 2.3 上,密集 attention(FlashAttention-3)的 VBench 综合分 75.90,Sol-Attn 拿到 76.13,质量比密集还略高,同时端到端 2.02 倍提速。和其它稀疏方法横向比:
| 方法 | VBench↑ | 端到端提速 |
| FlashAttention-3(密集) | 75.90 | 1.00× |
| PISA | 76.03 | 1.86× |
| Sparse-VideoGen2 | 75.22 | 1.85× |
| XAttention | 73.90 | 1.61× |
| Sol-Attn | 76.13 | 2.02× |
视频编辑(Bernini)上 Sol-Attn 2.34 倍,对 Sparse-VideoGen2 的 2.04 倍;一分钟长视频精修 3.04 倍对 2.08 倍。kernel 层面,在 H100 上高稀疏度时比 FlashAttention-3 快 11.5 到 32.7 倍,而 Sparse-VideoGen2 的路由结构要多占约 8 倍显存。
最具传播力的数字来自和 NVIDIA 自家推理框架 Sol-Engine 的叠加:核融合、扩散步缓存、Sol-Attn 三件套摞起来,在 B200 上对 Wan2.1-14B 端到端 3.48 倍,对 HunyuanVideo 5.08 倍。单跑 Sol-Attn 是 2.1 到 3.0 倍。
这是一个即插即用、训练无关的 kernel,跑 Wan、Hunyuan、LTX 这类视频模型的团队可以直接换上。视频生成推理贵,任何不重训就能拿两到三倍提速、质量还不掉的改动,都有实在价值。把路由融进 softmax、用近似代替丢弃这个设计,也不限于视频,对其他长序列扩散模型是可借鉴的思路。
作者自己说了三条:当前 B200 kernel 还没把 Blackwell 的性能吃满;只支持前向推理,没有反向、不能拿去训练;评测只覆盖双向扩散类的视觉生成,没碰自回归视频生成。还有一个存疑点:几乎所有对比都在和其它训练无关稀疏方法比,没和需要轻量微调的方法正面较量,所以这是「训练无关」赛道内的领先,不等于整体最优。