SemiAnalysis 拆解 GLM-5.3:稀疏注意力为何没能省下 HBM 内存
burny_tech · x · 2026-09-29
SemiAnalysis 发文分析 GLM-5.3 的稀疏注意力对 DRAM/HBM 内存需求的影响。
- 稀疏注意力只取 top-k 相关 token 参与 SDPA,降低了 KV cache 的带宽与访存需求,但 top-k 选择通常需要完整上下文驻留 HBM,并不能消除内存容量瓶颈,吞吐仍被容量卡住(来源:HiSparse)。
- SGLang 团队为此设计 HiSparse 分层内存系统:像 LRU 缓存一样在 HBM 与主机 DRAM 之间主动换入换出 KV cache;为降低 miss 延迟,沿用 HiCache 的层级重叠思路,把第 N 层的 KV 加载与第 N-1 层执行重叠。
- 结果:高并发、长上下文场景吞吐大幅提升,代价是 top-k cache miss 的 I/O 开销。
- 文章还涉及 DeepSeek Sparse Attention、IndexShare、Single-rollout 异步优化、AgentX TileRT 等推断优化技术,以及对存储(HBM/NAND)TAM 的产业影响分析(付费内容)。
「Infra」频道最新
- Brookings 论文预测 AI 基建投资达 10.3 万亿美元,融资风险被掩盖 — VraserX · 2026-09-29
- 蒙特利尔 Exploit Summit 亮点:Bittensor 生态大版图一览 — markjeffrey · 2026-09-29
- Bain 测算:AI 到 2031 年需年入 6 万亿美元才能撑住算力建设 — sanjaykalra · 2026-09-29
- 实测打脸:DGX Spark 上 bf16 反而比 int8 convrot 更快,H3 视频生成差 14 秒 — dtdisapointingresult · 2026-09-29
- BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍 — BAAI · 2026-09-29
- BAAI 推出 MALA 注意力:128K 上下文训练延迟降 2.2 倍 — BAAI · 2026-09-29