Wafer 推出号称最全的 AI 性能工程资源库,首篇拆解 Transformer 推理
ycombinator · x · 2026-09-12
Wafer 上周发布了自称全球最全面的 AI 性能工程(Performance Engineering)资源库,并计划把其中所有资源逐篇发布。该系列第一部分是《All About Transformer Inference》,出自《How To Scale Your Model》,系统讲解 transformer 推理背后的计算量、显存流量与服务决策:
- 线性层与注意力在 prefill 和 decode 阶段的算术强度(arithmetic intensity)分析
- 按层数、KV 头数、head 维度、序列长度与精度估算 KV cache 大小
- 计算/HBM 带宽交叉点,以及 batch size 和量化如何移动该交叉点
- 由参数字节数、KV 字节数和硬件带宽推出的 decode 延迟与吞吐上限
- 通过 batching 实现权重复用,以及 KV 流量增长带来的吞吐收益递减
- 还涉及 GQA、KV 量化、PagedAttention 等话题
作者建议把这条推串作为入门起点,详细链接在推文线程里。
「Infra」频道最新
- Zilliz CTO:Agent 记忆不是索引功能,而是长期运维的系统工程 — J_Luan_ · 2026-09-12
- Draw Things 新版上线:支持 MiniMax H3 与 Krea 2 模型 — antirez · 2026-09-12
- Together 称承接 OpenRouter 上 23%-30% 的 GLM 5.3 流量 — zhyncs42 · 2026-09-12
- 全球廉价电力争夺战:AI 数据中心该建在哪,训练与推理答案不同 — pravchaw · 2026-09-12
- 用股权融资买算力本末倒置,风投圈提议发明「硬件收入衍生品」 — ns123abc · 2026-09-12
- Relace 单日处理 1 万亿 token,占 DeepSeek v4 Flash 37% 流量 — stuffyokodraws · 2026-09-12