2026 版本地 LLM 推理引擎指南免费开放,覆盖笔记本到集群
blaizedsouza · x · 2026-09-07
Ahmad Osman 发布的《Inference Engines for LLMs & Local AI Hardware (2026 Edition)》现可免费在线阅读,被称为本地跑 LLM 的「圣经」。
核心观点:不要先选推理引擎,而应先确定硬件策略、工作负载形态和服务模型,引擎是随之而来的结果。
内容覆盖:
- 硬件场景:笔记本/边缘/奇葩硬件、Mac 优先工作流、单张 RTX、2-4+ 张 NVIDIA/CUDA GPU、生产级 serving、长上下文/MoE/路由、NVIDIA 极限性能、集群编排
- 软件栈:llama.cpp、MLX/MLX-LM、ExLlamaV2/V3、vLLM、SGLang、TensorRT-LLM、NVIDIA Dynamo
作者建议读者现在就读或先收藏。
「Infra」频道最新
- FP8/FP4 实际加速仅约 1.5x 与 2x,远低于理论值 — scaling01 · 2026-09-07
- 北方华创展示 64 层 3D DRAM 关键刻蚀工艺,绕开 EUV 延续密度扩展 — pstAsiatech · 2026-09-07
- 荷兰格罗宁根基于 Qwen 3.5 27B 微调建本土 AI,数据中心获补贴 — teortaxesTex · 2026-09-07
- 本周 AI 必读:OpenAI 研究加速报告与 Broadcom 167 亿 AI 芯片营收 — VibeMarketer_ · 2026-09-07
- 端侧Android agent实测:Gemma 4 E2B实时仅2.6 tok/s,回放却达11 — HowDevelop · 2026-09-07
- 开发者自写 Marlin 风格 FP4/FP8 内核,NVIDIA 拒绝合并 — QuixiAI · 2026-09-07