腾讯 HY 的 MC-Sparse 在 MiniMax 视频上只留 15% 注意力,去噪加速 1.80 倍

MC-Sparse: Deconstructing and Closing the Dense-Sparse Attention Gap in Diffusion Transformers

Jiarui Chen, Zeqiang Lai, Jiangshan Wang, Ziheng Ouyang, Ye Huang, Xiangyu Yue, Cewu Lu, Chunchao Guo

cs.CV, cs.AI

2026-10-06

免训练的 MC-Sparse 在锚点步精确挑选 KV 并缓存稠密与稀疏的残差,MiniMax-H3 视频以 15% 注意力密度把去噪加速到 1.80 倍,相对稠密输出 PSNR 为 27.30 dB。

这篇在解决什么

视频和 3D 生成把 Diffusion Transformer 的序列拉到数万 token。注意力随长度平方增长,每个去噪步都要算一遍,耗时集中在这里。稀疏注意力只留一小部分 query-key 交互,密度降到大约 30% 时,输出就会偏离稠密注意力。

免训练的做法大多是块稀疏。query 和 KV 切成对齐 GPU tile 的块,用均值池化打分,整块留下或丢掉。近似打分和块边界缠在一起,掉点来自哪一截说不清。

同密度 oracle 按真实注意力概率,尽量保住注意力质量。按块选、组内共享一套 token、每条 query 各自选,保真逐级变好。对照均值池化的 vanilla BSA,误差分成三份。结构绑定:无关邻居跟着重要 token 留下,同组 query 还得共用一份选择。选择误差:组均值 query 的 softmax 对不上组内注意力的平均。尾部误差:没选中的 token 权重不为零,per-query oracle 也消不掉。Wan2.1-1.3B 在 480p 的对照里,这三档都在。

方法

MC-Sparse 对着这三份误差改,权重不更新。分组和精确挑选只放在锚点步,之后复用查询分组、KV 索引和输出残差。

KV 逐 token 挑选,可以跨块。kernel 按索引在线收集,不再把 key、value 重新打包。query 仍要填满计算 tile,于是用 PDDP 把相似 query 切成恰好 C 条一组:投到主方向上,按中位数切开,直到组大小等于 tile。这样躲开 k-means 分组不均、补齐后实际交互超出名义预算的问题。

挑选目标是预算内 K 个 KV 上,该组注意力权重之和最大。锚点步用两遍 kernel 取 top-K。FlashAttention 不露出 logits,多出来的 QK 遍大约相当于半次稠密注意力的矩阵乘法。Fig. 4 显示,复用早先的精确索引,好过每步重算均值池化。各步的 Q、K、V 仍用当前步的值。

token 级选择把块切碎,块均值补不回尾部。锚点步记下稠密输出减稀疏输出。Fig. 5 里,这份残差沿去噪步的变化小于注意力输出本身。复用步的输出等于当前稀疏注意力加上该残差。分组、索引、残差同步刷新。显存不够时,缓存卸到 CPU 并预取下一层。

结果

加速只计 DiT 去噪,含热身,不含条件编码和 VAE 解码。PSNR、SSIM、LPIPS 比的都是稠密输出。

MiniMax-H3-Base、768p 文生视频:

方法密度PSNR↑SSIM↑LPIPS↓去噪加速
Sol-Attn32.4%23.660.8160.2341.59×
PISA30%23.450.8110.2431.52×
MC-Sparse25%28.440.8990.1611.61×
MC-Sparse15%27.300.8820.1761.80×

15% 密度比 Sol-Attn 更稀,PSNR 仍高约 3.6 dB,加速从 1.59× 提到 1.80×。稠密去噪 1062 秒,25% 与 15% 密度分别是 660 秒和 590 秒。ImgQual 从稠密的 69.20 到 69.00 与 68.94,BgCons 从 91.72 到 91.81 与 91.85。

HunyuanVideo-13B、720p:25% 密度 PSNR 32.89、加速 1.82×,15% 密度 PSNR 30.78、加速 2.00×。Sol-Attn 在 32.3% 密度为 28.06 dB、1.79×。Wan2.1-14B 文生与图生视频里,约 25% 密度的 MC-Sparse 取得所列稀疏方法中最高 PSNR、最高 SSIM 和最低 LPIPS:文生 28.81 dB、0.912、0.128,图生 32.11、0.929、0.117。

HY3D-Internal 的图生几何在 15% 密度加速 2.32×,相对稠密网格的 Chamfer 距离 0.177。PISA 在 25% 密度是 0.976,Sol-Attn 在 36.1% 密度是 1.901。体积 IoU 82.91,[email protected] 为 96.33。输入图一致性 Uni3D-I 0.3311、ULIP3D-I 0.1206,稠密是 0.3309、0.1204。

小模型消融在 Wan2.1-1.3B、480p、密度 0.2:vanilla BSA 的 PSNR 20.96,加上可复用精确选择 21.60,再改为 token 22.57,加上 query 分组 23.51,残差补上后 27.05。残差贡献 +3.54 dB。加到 vanilla BSA 只有 +1.25 dB,加到 PISA 只有 +0.49 dB。

Wan2.1-14B、720p、序列 75600 上,密度 0.2 的注意力 kernel(不含分组和选择)里,MC-Sparse 为 FA3 的 4.79 倍,达到理想加速的 96%,规则块 BSA 为 99%,PISA 为 82%,SVG2 为 80%。锚点开销摊完全程后,大约相当于密度增加 5 到 6 个百分点。分摊后的 Fast PDDP 分组,480p 与 720p 分别约为 Flash-KMeans 的 1/3.96 与 1/6.14。

为什么重要

训好的视频和 3D DiT 可以只替换去噪中的注意力,权重不动。15% 到 25% 的交互,对应大约 1.6 到 2.3 倍去噪加速,自动观感分仍贴着稠密输出。

残差单独补不上。PISA 已有块统计补偿,再叠上去不到 1 dB。token 级选择和等大分组先把误差理顺,尾部补偿才成为主增益。

锚点步要跑一遍完整稠密注意力,全程还要再付大约 5 到 6 个百分点的等效密度。序列不够长、注意力不是主耗时,净加速会薄一截。

局限与存疑

论文没有单列局限。

保真分衡量的是像不像稠密输出。MiniMax 在 15% 密度仍只有 27.30 dB,像素差还在。VBench 两项几乎打平,这组自动分没有把差别拉开,文中也没有用户研究。

主表密度经常不对齐。MC-Sparse 以更低密度同时拿到更高 PSNR 和更快速度,同密度的头对头不在主表里。3D 上 PISA 加速写成小于 1.87×,不能和 2.32× 直接相减。

组件消融停在 1.3B、480p。大模型里每一项贡献多少,没有再拆。HY3D-Internal 不公开,几何数字外部还不能复跑。

复用假设邻近去噪步里,注意力和残差变化得慢。图中复用间隔画到 25 步,少步蒸馏采样没有测。Wan2.1-14B 与 HunyuanVideo-13B 的残差加索引要传 2435 MB 和 2710 MB,预取能藏住传输,显存或 PCIe 紧时仍然受限制。需要重训的 SANA、VSA、SLA 不在比较里。

术语

原文与代码

相关论文

全部论文解读