降 12-Hi 到 8-Hi:每 GB 带宽升 50%, Rubin Ultra 的 HBM 算账
AccBalanced · x · 2026-09-06
SemiAnalysis 的后半段推导:容量 ≈ 堆栈数 × 每堆栈 die 数 × 单 die 容量;带宽 ≈ 堆栈数 × 接口宽度 × 引脚速度。堆叠高度只买容量不买带宽——从 12-Hi 降到 8-Hi 砍掉三分之一的 DRAM die(BOM 中供应最紧张的芯片),而带宽持平甚至略升。
- 每 GB 容量的带宽提升约 50%,恰逢 HBM 涨价,$/bandwidth 显著改善
- 推理是带宽瓶颈型负载:每解码一个 token 都要重读权重和 KV cache
- 因此 Nvidia 的取舍逻辑是优先带宽单位成本而非容量单位成本
所属事件:SemiAnalysis 揭示 Rubin Ultra HBM 降为 8-Hi 原因(2 条相关)→
「Infra」频道最新
- 从第一性原理吃透 KV Cache:一份覆盖 MHA/GQA/MLA 到 PagedAttention 的技术手册 — techNmak · 2026-09-06
- 双 GB10 桌面级方案,称可跑当前最强本地模型 — jasonkneen · 2026-09-06
- Reddit 用户实测:一个节点让 MiniMax H3 在 5090 上告别 OOM — denizbuyukayak · 2026-09-06
- Agent 时代 KV cache 挤爆 HBM,容量不足拖垮有效带宽 — AccBalanced · 2026-09-06
- 分析师测算混合键合 HBM 假想市场:年超 30 亿次 D2D 应用 — zephyr_z9 · 2026-09-06
- Ollama CEO:企业 80-90% token 将由开源模型承担,仅占成本 10-20% — victor_explore · 2026-09-06