LLM 推理手册汇总生产部署、选卡与优化指南
carrycooldude · x · 2026-07-29
LLM 推理手册把部署、选卡和优化知识一次讲全
这份 LLM Inference Handbook 被定位为给工程师用的统一参考资料,目标是解决 LLM 推理知识分散在论文、厂商博客、GitHub issue 和社区讨论里的问题。它从“推理和训练有什么不同”讲起,覆盖 tokenization、KV cache、量化、speculative decoding、disaggregated inference、continuous batching、prefix caching,以及 GPU 架构和 BYOC / on-prem 等部署方式。
手册也强调了生产环境里更关心的指标,比如 TTFT(首 token 时间)、TPS(每秒 token 数),以及为了满足 SLO,goodput 往往比原始吞吐更重要。页面还提供计算器、模拟器和可视化工具,面向的是要把 LLM 跑快、跑稳、跑便宜的团队。
「Infra」频道最新
- Bittensor 年度 2.5 亿美元发行量只占大厂 AI 支出的极小一部分 — bittingthembits · 2026-07-29
- 4张 RTX 6000 实测视频生成:3秒1080p耗时20分钟 — NewVeterinarian5384 · 2026-07-29
- Allen AI 地球观测平台测绘北美野火风险,并行提速 155 倍 — allen_ai · 2026-07-29
- Ai2 发布 OlmoEarth 平台:实现行星级地理空间推理 — allen_ai · 2026-07-29
- Databricks 称 AI agents 正在重塑事务库与分析库架构 — matei_zaharia · 2026-07-29
- 台积电日本工厂遭遇7.0级地震,市场恐慌致内存股下跌 — dejavucoder · 2026-07-29