VC-Attention:免训练低比特注意力,视频生成提速最高 3.6 倍
nunchux-inc · hf · 2026-09-17
扩散 Transformer 的视频生成长序列让注意力成为部署最大成本,低比特量化又受两大瓶颈:Value 的离群值无明显通道/时空结构,是输出误差主因;softmax 的高精度指数运算成为数据中心 GPU 上最长流水段。VC-Attention 提出免训练方案:
- V-Smooth:用轻量在线聚类重排 value token,使同一硬件块内的 token 量化表现相近;只量化减去块均值后的残差,均值由在线 softmax 已维护的行和恢复
- ExpCast-FP8:用一次融合乘加把 log 域分数直接映射为 E4M3 概率码,消除 FP32 指数运算与格式转换
已在 B200、B300、H200、RTX PRO 6000、RTX 5090 上实现。在 Wan2.2、LongCat-Video、HunyuanVideo-1.5、MiniMax-H3 上:相比 BF16 FlashAttention-4,注意力核在数据中心 Blackwell/Hopper 上提速 1.46–1.59 倍,工作站卡上 2.3–3.6 倍;端到端整段生成分别提速 1.13–1.19 倍和 1.36–1.70 倍,同时保真度优于低比特基线。
所属事件:VC-Attention 免训练低比特注意力在 B200 上提速 1.6 倍(3 条相关)→
「Infra」频道最新
- Token 之外的成本黑洞:语音分钟数与沙箱容器费无人监控 — Any_Warning_1183 · 2026-09-17
- 曲率条件多尺度动量新优化器:显著加速 Muon,覆盖 0.12B-2.3B 模型 — YouJiacheng · 2026-09-17
- Vitalik 实测 Qwen 3.8 flash:笔记本本地跑分亮眼,本地模型拐点将至 — anselm · 2026-09-17
- 曝华为昇腾 960DT 拟 2027 年 Q1 推出,960PR 起支持 fp4 优化 — zephyr_z9 · 2026-09-17
- M5 Ultra 跑分泄露:OpenCL/Metal 测试反超 RTX 5090 台式卡 — bingxu_ · 2026-09-17
- 马斯克确认 Starlink V5 终端投产,速度可达 375Mbps 以上 — elonmusk · 2026-09-17