LLM 推理工程教程:从 KV Cache 到 vLLM
techNmak · x · 2026-08-19
这是一个系统学习 LLM 推理工程的资源,涵盖 KV Cache、PagedAttention 和 Continuous Batching 等基础概念,以及 vLLM、SGLang 和 GPU 的实际应用。教程旨在帮助开发者理解推理优化技术,分为多个部分逐步深入。
「Infra」频道最新
- 为何消费级内存紧缺?服务器需求撞车 — davidmanheim · 2026-08-19
- 研究员预判:DDR5 将维持高价,DDR4 或在 DDR6 后回落 — davidmanheim · 2026-08-19
- Inco AI 推出 DFlash 2,推理提速最高 4.6 倍 — igilitschenski · 2026-08-19
- 未来能否在小显存 GPU 上运行 30B+ 参数的大模型? — absurdother · 2026-08-19
- Periodic Labs 基于 Miles 框架训练万亿参数模型,吞吐提速3倍 — hsu_byron · 2026-08-19
- 本地 LLM 速度瓶颈解析:4090 与 5090 性能差异 — Viktri1 · 2026-08-19