推理工程被严重低估:从 KV Cache 到 p99 延迟的完整技术版图
techNmak · x · 2026-09-07
作者认为推理工程(Inference Engineering)正成为 AI 最重要的技能之一,却被多数工程师低估。训练备受关注,但模型上线服务真实流量后会出现完全不同的问题:排队、批处理、KV cache 压力、GPU 显存、调度、内核效率与尾延迟。
核心要点:
- Prefill 与 Decode 本质不同:Prefill 处理 prompt、构建 KV cache,可高效并行,偏计算密集;Decode 逐 token 自回归,反复读取权重与 KV 状态,在实际 batch 规模下严重受内存带宽约束。
- 现代优化技术因此成体系:FlashAttention 降低注意力内内存流量,PagedAttention 改进 KV cache 内存分配,GQA/MQA 减少每 token 的 KV 状态,Continuous batching 让调度器持续混合活跃序列,Chunked prefill 防止长 prompt 垄断执行,Prefix caching 避免重复计算已处理上下文。
- 规模化带来新难题:张量并行省显存但增加通信,流水线并行引入调度复杂度和流水线气泡,MoE 服务需处理专家路由与负载不均;部分系统干脆把 prefill 和 decode 分到不同 worker。
- tokens/s 是危险的不完整指标:生产系统还要关注 TTFT、token 间延迟、吞吐、排队延迟、KV cache 利用率、p95/p99 延迟与 goodput——聚合吞吐漂亮但用户等首 token 太久很常见。
- 推理工程位于 ML 系统、分布式系统、编译器、GPU 架构、网络与性能工程的交汇处;模型越大、服务量越大,「让每块 GPU 干更多有用的活」本身就是一门工程学科。
「Infra」频道最新
- Merge Gateway 推出 DeepSeek V4 Flash 七五折:输入每百万 token 仅 4 美分 — shensi · 2026-09-07
- 「自托管 AI」的神话:本地模型仍绕不开云在环 — nomad-nostalgia · 2026-09-07
- 四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁 — dowitex · 2026-09-07
- AI 能否完全跑在手机上?端侧推理或颠覆 OpenAI 的收费模式 — kevinsurace · 2026-09-07
- Polymarket:年内有州通过数据中心禁令的概率达 73% — Polymarket · 2026-09-07
- 路州一家塔可店 40% 月营业额竟来自 Meta AI 数据中心 — Polymarket · 2026-09-07