Attention Residuals算子提速27倍
teortaxesTex · x · 2026-07-20
开发者 @willea 发布了一个名为 flash-attn-res 的 Python 包,将 Attention Residuals(注意力残差)机制封装为像普通 PyTorch 算子一样易用的接口,号称实现了 27倍的速度提升。
该实现无需复杂的底层编译或自动求导配置,核心优化技术包括:
- 融合的 Triton kernels
- 针对 residual blocks 的批量注意力机制
- 在线 softmax 合并
- 类 Flash Attention 的 split-KV 归约
此前该机制已在月之暗面的 Kimi K3 模型上完成了大规模验证。
「Infra」频道最新
- 新论文提出 PoLar:动态跳过或循环 LLM 层级以优化推理 — ttkciar · 2026-07-22
- SK海力士CEO:明年将是行业史上供应最紧张的一年 — Beth_Kindig · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- 分析称五大科技巨头隐匿 1.6 万亿美元 AI 债务 — arto · 2026-07-22
- DeepSeek-V4-Flash 单卡 B300 批量仅 770 tok/s — Moreh · 2026-07-22
- NVIDIA 开始交付 102.4 Tbps 的 Spectrum-6 交换机 — nvidia · 2026-07-22