OpenAI 揭秘推理路由:比例控制器为何换成全局优化器
AI Engineer · youtube · 2026-09-19
OpenAI 的 Qianru Lao 与 Lu Zhang 在一场工程演讲中复盘了推理负载均衡的演进。旧方案是一个反馈回路:引擎上报信号,控制器把信号平滑成分数并与集群均值比较,按比例上下调路由权重。它有不少优点(多信号合成一个决策、受限于约束的引擎能自我平衡),但行为难以解释——调一个属性另一个跟着动,最糟的是振荡:把流量从热引擎移走后它冷却,控制器把冷读成空闲容量又把流量送回去,来回弹跳破坏了路由本要保护的 KV cache 局部性。
替代方案是控制面 + 数据面架构:控制面拥有所有 CPU 集群与 GPU 引擎的全局视图,数据面在每个集群内用缓存的路由权重快照同步回答「这个请求由哪个引擎服务」。信号仍会流动,但汇入的是一个优化器,目标是在网络距离与引擎侧排队之下最小化全流量的期望端到端延迟,约束是每个请求必被路由且引擎不超容量。
「最近引擎」不一定对:一个区域以 120 req/s 打向只能服务 100 的引擎,而两个区域外有引擎只用了 80 容量中的 40,算上排队时间后更远的引擎反而赢。最后是保护机制:离群惩罚、随利用率升高而收紧的 retry 预算(防 retry 风暴)、以及最后手段的负载丢弃。
「Infra」频道最新
- 谷歌工程师实测:LLM 基准测试工具会静默丢请求,200 QPS 只跑出 38 — AI Engineer · 2026-09-20
- 跑 Emacs 刷 X 的自建主机现比汽车还贵,GPU 涨价梗图走红 — tetsuoai · 2026-09-19
- M4 每周期可执行 10 条指令,超多数竞品,M5 提速另有玄机 — lemire · 2026-09-19
- Apple M6 核心数增至12,作者解析CPU仍在快速进步 — lemire · 2026-09-19
- Apple M2 到 M5 三年性能提升约 50%, gradual 无跳跃式增长 — lemire · 2026-09-19
- DGX Spark 双机太贵,本地 AI 硬件 affordability 引热议 — FlolightC · 2026-09-19