LLM 推理一次只算一个 step:连续批处理如何榨满 GPU
arpit_bhayani · x · 2026-08-26
Arpit Bhayani 图解 continuous batching(连续批处理) 的原理:
- 生成响应是一个循环:每次迭代对当前序列跑一次前向、产出一个新 token,500 token 的回答就是 500 个独立的 step。
- 连续批处理把 step 与请求解耦:每个 token 生成后,调度器检查 batch,已命中 EOS 的序列立即逐出,排队的新请求立刻填进空位——新请求的第 3 个 token 可以和长请求的第 400 个 token 同处一个 batch。
- GPU 不关心各序列处于什么阶段,只对当前 batch 里的序列做前向。
- 这之所以可行,是因为 attention 和 KV cache 是按序列独立计算的(借助 PagedAttention 高效管理各请求的内存区域),不同阶段混批不会污染任何请求的上下文。
结果是 GPU 利用率保持高位、平均延迟下降,没有请求被先到的慢请求卡住。
「Infra」频道最新
- 开发者开源图表搜索层,158ms 内精准定位视觉证据 — RichardsonDx · 2026-08-26
- Akta 推出企业数据 API,为 Agent 提供结构化信息 — AppropriateAnt7344 · 2026-08-26
- 阿里RecGPT-Mobile-V2:端侧行为预测模型技术报告 — _reachsumit · 2026-08-26
- AMD MI350X 跑通 Qwen3.6-35B:开源 Kernel 实现 8 卡 7.8 万 tok/s — SmilingGen · 2026-08-26
- MetricFire 发布 MCP 服务器,让 AI 查询监控数据 — PKMNPinBoard · 2026-08-26
- 曝 OpenAI 新芯片能效比超英伟达 Rubin — nickbaumann_ · 2026-08-26