推理瓶颈三阶段演变:长上下文让 HBM 容量取代 KV 读取成新约束

YouJiacheng · x · 2026-09-11

YouJiacheng 在回复中梳理了 LLM 推理瓶颈的演变:最初注意力上下文短,瓶颈在权重加载;第一阶段的演进是长上下文工作负载使 KV cache 读取成为主导瓶颈;而到当前阶段(他称「第二次演进」),DSA(深层稀疏注意力)加上更长的上下文工作负载,使 batch size 反而受限于 HBM 容量,而非 KV 读取或交互性约束。他还指出,投机解码等技巧无法改变这一格局,因为瓶颈源于模型与负载的本质特性。

所属事件:LLM 推理瓶颈演变:从权重加载到 HBM 容量约束(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →