推理提速不只靠模型:拆解 6 项 LLM 服务端关键优化技术
techNmak · x · 2026-09-23
rohanpaulai 长文指出,LLM 推理性能很大程度来自模型之外的服务端技术。他系统拆解 6 项各有针对的优化:
- Prefix caching:共享前缀(系统提示、文档、few-shot)的 KV 状态只算一次,后续请求复用,省掉重复 prefill。
- Continuous batching:迭代级调度让完成的请求随时退出、等待请求随时加入,GPU 不再被固定请求组绑定。
- PagedAttention:把 KV 缓存切成非连续块按需分配,解决连续预留导致的过度分配与碎片化——本质是 KV 内存管理而非更快的注意力近似。
- Chunked prefill:把长 prompt 的 prefill 切小与 decode 混排,避免一个大 prefill 独占迭代;权衡是切分本身带来额外开销。
- Speculative decoding:廉价草稿模型先提议多个 token,目标模型一次性验证,在保持采样分布不变的前提下加速;只有省下的目标步数超过草稿+验证成本时才划算。
- Prefill/decode disaggregation:prefill 偏算力密集、decode 偏内存带宽受限,DistServe、Splitwise 等系统将两者放到不同 worker 池。
「Infra」频道最新
- 高通新芯片亮点:用闪存按需流式加载 30B MoE 权重 — ryanshrout · 2026-09-23
- 高通骁龙峰会:Hexagon NPU 可跑 30B+ 参数 MoE 模型 — samcharrington · 2026-09-23
- OpenAI 改进 GPT-6 提示缓存:命中率更高、新增诊断与显式断点 — OpenAI News · 2026-09-23
- NCCL 2.31.2 发布:GPU 驱动细粒度通信与 0-SM 集合通信等改进 — SkyLi0n · 2026-09-23
- vLLM ROCm 核心维护团队直到近期才拿到持久 MI355X 集群 — AccBalanced · 2026-09-23
- 南非民权组织抗议美国科技公司数据中心扩张,要求暂停建设 — ChinasaTOkolo · 2026-09-23