S2-Attention:用 Triton 内核让稀疏注意力真正跑出实测加速

burkov · x · 2026-09-11

标准稠密注意力的二次方开销让大模型训练与推理面临算力和内存瓶颈;稀疏注意力虽降低了理论计算量,却常因缺乏硬件级内存优化而拿不到实际加速,且长上下文场景下精度受损。推理期的动态 token 驱逐还会在 PagedAttention 等服务框架中造成内存碎片与调度开销。

论文提出 Sparsely-Sharded Attention(S2-Attention),一个硬件感知的 Triton 内核库,在不牺牲精度的前提下实现实测加速。核心是名为 Merge-Q 的动态 query 合并技术:把共享同一批 key-value 数据的 query 块分组合并到同一计算 tile 中,减少冗余加载,从而把稀疏性转化为真实的墙钟时间收益。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →