Modular 开源 LLM 推理手册:20+ 交互可视化覆盖全栈优化
carrycooldude · x · 2026-09-22
Modular 发布免费的 LLM Inference Handbook,把分散在论文、厂商博客和 GitHub issue 中的大规模推理优化知识系统整理成一份可查询的参考手册。
- 覆盖主题:TTFT、TPOT、goodput、continuous batching、chunked prefill、prefix caching、KV cache 数学、prefill-decode 拆分、量化、GPU 架构、BYOC 与本地部署等。
- 内含 20+ 交互式可视化/计算器/模拟器,可从头到尾阅读也可当查找表用。
- 持续更新并开放 PR,所有页面可在 URL 后加 .md 获取 Markdown 版本。
- 目标读者是在生产环境部署、扩展和运维 LLM 的工程师,目标是让推理更快、更便宜、更可靠。
「Infra」频道最新
- 应对 AI 爬虫流量:Turnstile 之外的 Cloudflare AI Labyrinth 方案 — fforres · 2026-09-22
- 技术评论:某 RL 训练弃用 PipelineRL 保留 KV cache,改用重新 prefill — stochasticchasm · 2026-09-22
- cHHillee:软件护城河难敌 RSI,ML 基建价值在需求聚合 — PatrickToulme · 2026-09-22
- 树莓派固件锁定原始内存容量,禁止用户换更大 RAM — ngxson · 2026-09-22
- cHHillee 谈 Tinker 护城河:软件调优非壁垒,算力聚合才是 — cHHillee · 2026-09-22
- fal 推出 H3 Max:3 秒生成 5 秒前沿级视频,全栈优化揭秘 — gorkem · 2026-09-22