LLM 推理手册汇总生产部署、选卡与优化指南

carrycooldude · x · 2026-07-29

LLM 推理手册把部署、选卡和优化知识一次讲全

这份 LLM Inference Handbook 被定位为给工程师用的统一参考资料,目标是解决 LLM 推理知识分散在论文、厂商博客、GitHub issue 和社区讨论里的问题。它从“推理和训练有什么不同”讲起,覆盖 tokenization、KV cache、量化、speculative decoding、disaggregated inference、continuous batching、prefix caching,以及 GPU 架构和 BYOC / on-prem 等部署方式。

手册也强调了生产环境里更关心的指标,比如 TTFT(首 token 时间)、TPS(每秒 token 数),以及为了满足 SLO,goodput 往往比原始吞吐更重要。页面还提供计算器、模拟器和可视化工具,面向的是要把 LLM 跑快、跑稳、跑便宜的团队。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →