拆解 NVIDIA Dynamo 路由设计:用单一指标解决 GPU 负载与缓存
Abhishekcur · x · 2026-07-28
作者详细解析了 NVIDIA Dynamo 的 LLM 路由机制。其核心设计是将等待的工作量、占用的空间以及可跳过的缓存统一转化为同一个度量单位(缓存块),从而将每个 GPU 的状态简化为一个单一数值,路由器只需选择数值最小的 GPU。
缓存与空间的权衡
- 记忆即折扣:记住用户的 prompt 并不直接决定路由走向,而是作为一种成本折扣。折扣大小取决于记忆所在的位置:在 GPU 上折扣最大,普通内存次之,磁盘最小。
- 空间与工作:空间是指请求运行期间实际占用的资源,而记忆(缓存)只是帮你省去了重复读取的工作。两者是截然不同的概念。
排队时间决定胜负
- 路由器评估的首要因素是该 GPU 当前积压的读取工作量(排队队伍长短),而非单纯看新请求本身的大小。
- 实测表明,即使某个 GPU 拥有完美的 prompt 记忆,如果它正处于繁忙状态(排队长),其性能表现依然会被一个空闲但毫无记忆的免费 GPU 轻松击败。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23