推理工程入门:Prefill/Decode 分离与 KV Cache 优化全解析

techNmak · x · 2026-10-07

一篇系统讲解推理工程(Inference Engineering)重要性的长文,作者认为训练被过度关注,而真正服务线上流量时的工程问题被低估。

核心框架:Prefill 与 Decode 分离

关键技术及其解决的问题

调度策略

内存:权重只是 GPU 显存的一部分,KV cache 随保留 token 数增长,其大小取决于层数、缓存 token 数、KV 头数、head 维度和每值字节数——这正是 MQA/GQA 对 serving 至关重要的原因。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →