kipply 推出推理成本算术教程,拆解 H200/B200 上的 prefill 与 decode 开销
ycombinator · x · 2026-09-29
waferai 发布号称最全面的 AI 性能工程系列仓库,第 6 部分由 Carol Chen(kipply)主讲 Transformer 推理算术。
- 围绕每个 token 所需的计算量、GPU 搬运的字节数与 GPU 间通信,构建近似推理成本模型,可用于分析 H200/B200/B300 上的延迟与吞吐。
- 示例基于 A100,并结合 NVIDIA Hopper 与 Blackwell 文档展开应用。
- 关键结论:prefill 与 decode 暴露的 token 并行度不同——prefill 一次性处理 prompt token,矩阵乘有更高的权重复用;小 batch decode 复用少,可能大部分时间花在加载权重而非计算上,应分阶段做 profiling。
- batching 可提升算术强度(arithmetic intensity),但文中被截断。
「Infra」频道最新
- 单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方 — DimeRhyme · 2026-09-29
- Reddit 热议:千元级本地跑 SOTA 模型的设备是下一个大机会 — Robert__Sinclair · 2026-09-29
- SemiAnalysis:6000 个数据中心项目仅 3 个受暂停令影响 — MatthewBerman · 2026-09-29
- Cloudflare 生日周开源大礼包:forge、vinext 1.0、Rust Workers 等 8 项更新 — ritakozlov · 2026-09-29
- 谷歌趋势美国区榜首全是怀俄明州?作者疑因数据中心机器流量 — lilyraynyc · 2026-09-29
- Sentdex:本地跑了 40 亿 token,GLM 5.3 Flash 成其最常用本地模型 — Sentdex · 2026-09-29