高带宽闪存 HBF 算账:约 4900 个 NAND 平面并发才能匹敌 H200
lauriewired · x · 2026-09-08
安全研究员 lauriewired 发长文分析 High-Bandwidth Flash(HBF)的技术路径。要点:
- 量级差距:要达到 H200 约 4.8TB/s 的带宽,HBF 需要约 4900 个 NAND 平面并发读取 4KB 数据块,靠的是极端并行而非单通道速度。
- 核心问题:这种并行由软件(程序员手工聚合请求)还是硬件控制器隐藏,是整个方向的关键。
- 两条路线:华为 FLINT 用硬件控制器方案,在 SRAM 中存突发转换表、聚合并发请求后向 512 个平面突发读出,但是被动式的、只适合读(如加载模型权重);另一篇 FlashAccel 论文走软硬件协同设计,把请求聚合为 plane→megaplane→hyperpage(4608 平面),可当 KV-cache 使用。
- 判断:裸 HBF 会很糙,第一代可用方案类似 FLINT,长期看 FlashAccel 类设计才是真正实用的层级。
作者称理解这套东西的人「对未来有约 3 年的先发优势」。
所属事件:安全研究员拆解高带宽闪存:对标 HBM 难度被指极高(2 条相关)→
「Infra」频道最新
- AI 机柜光互连供应链拆解:InP 衬底与硅光或是更干净的上游布局 — demian_ai · 2026-09-08
- Hugging Face 自研 WebGPU 推理引擎亮相:实验提速 5-10 倍 — nicodotdev · 2026-09-08
- PyTorch 大会将深讲 Meta 推荐系统推理优化实战 — PyTorch · 2026-09-08
- AI 挤压存储 supply,4TB 移动 SSD 涨价惊呆开发者 — demian_ai · 2026-09-08
- NVIDIA Sol 助 MiniMax-H3 提速:8 卡 B300 上 5 秒视频 1.653 秒生成 — MiniMax_AI · 2026-09-08
- GLM-5.3-Flash 极致量化版跑上 DGX Spark,带视觉 18-25 tok/s — pbaylies · 2026-09-08