Modal 工程师 Charles Frye 系统讲解推理引擎:从调度器到 KV 缓存与投机解码
AI Engineer · youtube · 2026-10-06
Modal 的 Charles Frye 在 AI Engineer 大会做了一个小时的推理引擎科普与技术深潜,用一个「博物馆铭牌生成器」应用的首 token 延迟劣化案例切入,展示如何从监控面板读出排队问题、用加副本缓解。
核心内容:
- 请求全链路拆解:server IO → tokenization → 调度 → 模型执行 → detokenization,以 SGLang 和 vLLM 为参照
- 调度器常是被忽视的瓶颈:它计算量极小,却决定什么请求能上 GPU;聊天机器人、后台 agent、文档处理三类工作负载的延迟预算、输入输出长度和前缀复用需求完全不同
- 性能技术盘点:KV 缓存(容量与布局决定吞吐)、CUDA graphs(减少 CPU 侧重复启动开销)、投机解码(speculator 一次提出多个 token 供目标模型批量验证)、kernel 库与 batching 组织
- 生产调试实践:评测真实部署环境、记录 token ID 以定位 tokenizer 问题、收集足够 metrics 与 traces 跨副本排查回归
作者推荐用 mini-sglang 这类小型参考引擎读源码入门。完整时间戳与配套资料见视频描述。
「Infra」频道最新
- Reddit 求实测:128GB M5 Max Mac Studio 能扛住多智能体本地推理吗 — Simple_Telephone_867 · 2026-10-06
- 网友算账:大模型订阅价被补贴,MiniMax 推理毛利高达七八成 — menhguin · 2026-10-06
- 前沿实验室约 90% 算力已投向后训练与推理 — IanAndrewsDC · 2026-10-06
- KLIF 开源:一个窗口统一管理 llama.cpp、vLLM 等本地推理服务器 — Koksny · 2026-10-06
- 双 RX 7900 XT 跑 Qwen 27B 实测:单流最高 66.5 TPS,离网传 100+ 差多远 — EqualCryptographer67 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06