VC-Attention:免训练低比特注意力,视频生成提速最高 3.6 倍

nunchux-inc · hf · 2026-09-17

扩散 Transformer 的视频生成长序列让注意力成为部署最大成本,低比特量化又受两大瓶颈:Value 的离群值无明显通道/时空结构,是输出误差主因;softmax 的高精度指数运算成为数据中心 GPU 上最长流水段。VC-Attention 提出免训练方案:

已在 B200、B300、H200、RTX PRO 6000、RTX 5090 上实现。在 Wan2.2、LongCat-Video、HunyuanVideo-1.5、MiniMax-H3 上:相比 BF16 FlashAttention-4,注意力核在数据中心 Blackwell/Hopper 上提速 1.46–1.59 倍,工作站卡上 2.3–3.6 倍;端到端整段生成分别提速 1.13–1.19 倍和 1.36–1.70 倍,同时保真度优于低比特基线。

所属事件:VC-Attention 免训练低比特注意力在 B200 上提速 1.6 倍(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →