Meta 工程师拆解大规模分布式推理:推理需要自己的控制平面
AI Engineer · youtube · 2026-09-19
Meta 工程师 Nishant Gupta 与 Naman Ahuja 在 AI Engineer 演讲中系统讲解 Meta 大规模推理系统的运维经验。核心观点:
- Meta 推理流量已超过全球最大微服务规模,是其史上增长最快的工作负载;AI 正经历 2008 年云计算类似的演进,价值正向上移到编排层。
- 关键新问题是「耦合」:路由决策改变缓存命中率→改变批处理构成→改变 GPU 利用率→影响自动伸缩;一个请求如同分布式事务,任何一跳都可能重试、超时或失败,流式输出 200 token 后抢占 GPU 无法简单重试,可靠性必须放在能看到全局工作流的控制平面。
- 推理调度器需感知七个维度:GPU 代际、内存余量、KV cache 状态、权重是否热、租户优先级、延迟预算、工作流上下文(五步工作流失败在第三步会浪费前两步的消耗)。
- 所有优化归入四象限:缓存避免工作、批处理共享工作、路由转移工作(到更便宜模型/区域)、准入控制延迟工作;核心指标应是「每个成功任务的成本」而非每 token 成本。
- 结论:可观测性是控制回路的输入,推理需要在延迟/成本/吞吐三角中做权衡,如同虚拟机需要 Kubernetes,推理需要自己的控制平面。
「Infra」频道最新
- 跑 Emacs 刷 X 的自建主机现比汽车还贵,GPU 涨价梗图走红 — tetsuoai · 2026-09-19
- M4 每周期可执行 10 条指令,超多数竞品,M5 提速另有玄机 — lemire · 2026-09-19
- Apple M6 核心数增至12,作者解析CPU仍在快速进步 — lemire · 2026-09-19
- Apple M2 到 M5 三年性能提升约 50%, gradual 无跳跃式增长 — lemire · 2026-09-19
- OpenAI 揭秘推理路由:比例控制器为何换成全局优化器 — AI Engineer · 2026-09-19
- DGX Spark 双机太贵,本地 AI 硬件 affordability 引热议 — FlolightC · 2026-09-19