Agent 时代 KV cache 挤爆 HBM,容量不足拖垮有效带宽
AccBalanced · x · 2026-09-06
转发讨论反驳了一个常见观点:仅看 HBM 引脚带宽不足以判断推理性能。
- 只有当 KV cache 始终装得进 HBM 时,带宽论才成立;而在 agentic 时代(长上下文、多轮任务),KV cache 经常超出 HBM 容量。
- 一旦超出,token 会下溢到 DRAM/NAND 等更慢的存储层,等待时间显著增加。
- 在分层内存系统中,容量与带宽不可分割:HBM 是快车道,容量决定它会不会堵塞。削减 HBM 容量省的钱,最终会以有效带宽下降的形式还回去。
「Infra」频道最新
- 分析师测算混合键合 HBM 假想市场:年超 30 亿次 D2D 应用 — zephyr_z9 · 2026-09-06
- Ollama CEO:企业 80-90% token 将由开源模型承担,仅占成本 10-20% — victor_explore · 2026-09-06
- SemiAnalysis 算账:Nvidia 将 Rubin Ultra HBM 从 12-Hi 降为 8-Hi 的原因 — AccBalanced · 2026-09-06
- GPU 慢 5% 推理没事训练致命:训练与推理健康检查逻辑相反 — AccBalanced · 2026-09-06
- Substack 发布 Hot Chips 2026 投资视角回顾分析 — jwt0625 · 2026-09-06
- 训练前预判发散概率,新研究助大模型训练省算力 — burkov · 2026-09-06