PWT 稀疏注意力新法:无需微调,视频生成端到端提速 2.5 倍
青稞AI · wechat · 2026-07-31
本文深入探讨了注意力机制的优化路径,指出稀疏注意力(丢弃低权重)与线性注意力(整体线性近似)具有天然的互补性。
作者解析了 SLA 和 PISA 等现有方案,并提出了一种名为 PWT(Piecewise-Taylor) 的改进方法。PWT 通过引入二阶泰勒展开项,弥补了 PISA 仅有零阶近似的缺陷,利用块内协方差矩阵修正了质量低估问题。
核心优势与细节:
- Training-free:PWT 的精确与近似分支共享同一分母,天然无需微调即可直接替换 full attention。
- 性能提升:在 85% 稀疏度下,训练端到端(前向+反向)相比 full attention 实现约 2.5 倍加速,且单步近似精度超越 PISA。
- 工程踩坑:在真实 DiT 激活值中,少量异常维度会导致二阶项爆炸。作者通过引入有效性阈值进行置零操作,成功解决了生成质量崩溃的问题。
PWT 的前向与反向 Kernel 实现已开源。
「Infra」频道最新
- 微软 Q4 营收 900 亿美元,AI 成核心增长引擎 — emmanuelvivier · 2026-07-31
- AI数据中心噪音达105分贝,科技巨头遭多地居民集体诉讼 — mkheck · 2026-07-31
- Yahoo 利用 Amazon Bedrock 实现搜索重定向,关键词扩展率提升 600 倍 — AWS ML Blog · 2026-07-31
- 分析师称AI基本面未变:算力仍匮乏,全球渗透率极低 — BenBajarin · 2026-07-31
- AI 算力建设热潮验证了 KPCB 绿色科技基金 — matt_slotnick · 2026-07-31
- 中国 DUV 光刻机进展:目标非替代 ASML,而在打通迭代闭环 — demian_ai · 2026-07-31