NVIDIA H100 全局负载并发响应性能实测
ssh4net · x · 2026-08-19
论文研究了 NVIDIA H100 SXM5 上 Plain Global Loads 的并发响应特性。通过使用 Little’s Law 和微基准测试,作者发现内存带宽取决于内核在传输中保持的字节数。主要结果显示,在主要配置下,随着每个线程负载 K 从 2 增加到 8,LDG 带宽达到峰值后下降约 35%。这一下降趋势在不同控制实验中均稳定存在,揭示了 Hopper 架构在特定负载路径下的性能特征。
「Infra」频道最新
- Inco AI 推出 DFlash 2,推理提速最高 4.6 倍 — igilitschenski · 2026-08-19
- Periodic Labs 基于 Miles 框架训练万亿参数模型,吞吐提速3倍 — hsu_byron · 2026-08-19
- 本地 LLM 速度瓶颈解析:4090 与 5090 性能差异 — Viktri1 · 2026-08-19
- LLM 推理工程教程:从 KV Cache 到 vLLM — techNmak · 2026-08-19
- DFlash 2 发布:MacBook 跑 Qwen3.8-27B 速达 70 tok/s — songhan_mit · 2026-08-19
- HBF 替代 SSD 做 KV 缓存被指会烧毁寿命 — zephyr_z9 · 2026-08-19