图解 Continuous batching:vLLM 23 倍吞吐背后的调度技术
blaizedsouza · x · 2026-09-15
Daily Dose of DS 转发并摘引一篇讲解 LLM 推理调度关键技术 continuous batching 的长文(该技术支撑了 vLLM 的 23 倍吞吐提升,并已成为几乎所有主流推理引擎的默认调度器)。
- 传统 ML 推理:一个 batch 就是一个矩阵,所有输入 padding 到相同长度,一次前向传播同时结束。
- LLM 解码不同:一次前向只产出一个 token,请求数次数取决于输出长度,而这个长度直到模型输出 stop token 前都不可知。
- 静态批处理的问题:batch 成员在开始时固定,30 个 token 就结束的请求要占用显存/算力槽位直到同批最慢的 400 token 请求完成;GPU 读取模型权重的开销与槽位是否被实际使用无关,大量算力被空槽浪费。
- Continuous batching 的核心:把调度决策的边界从「batch 开始」移到「每个 token 步」,完成的请求即时退出、新请求即时插入,从而持续保持 batch 满载。原文还覆盖 token 预算、KV cache 分配与抢占机制等内部细节。
这也是 LLM 面试的高频问题,适合作为推理系统入门材料。
「Infra」频道最新
- NVIDIA 四张 B200 跑 Nemotron 3 Ultra,优化后并发用户提升 2.5 倍 — NVIDIAAI · 2026-09-15
- 本地跑模型到底花多少电费?开发者给 harness 加了成本计算器 — giveen · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15
- 纯 C99 单引擎同时跑 BitNet 与 GGUF,Xeon 上 36 tok/s — shifu_legend · 2026-09-15
- 开发者求助:用 ChatGPT 订阅 OAuth 顶替 API 做生产应用可行吗 — builtforoutput · 2026-09-15
- Cognichip 发布 ACI Enterprise:一名工程师 10 天完成前端芯片设计 — kimmonismus · 2026-09-15