S2-Attention:用 Triton 内核让稀疏注意力真正跑出实测加速
burkov · x · 2026-09-11
标准稠密注意力的二次方开销让大模型训练与推理面临算力和内存瓶颈;稀疏注意力虽降低了理论计算量,却常因缺乏硬件级内存优化而拿不到实际加速,且长上下文场景下精度受损。推理期的动态 token 驱逐还会在 PagedAttention 等服务框架中造成内存碎片与调度开销。
论文提出 Sparsely-Sharded Attention(S2-Attention),一个硬件感知的 Triton 内核库,在不牺牲精度的前提下实现实测加速。核心是名为 Merge-Q 的动态 query 合并技术:把共享同一批 key-value 数据的 query 块分组合并到同一计算 tile 中,减少冗余加载,从而把稀疏性转化为真实的墙钟时间收益。
「Infra」频道最新
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11