NVIDIA Dynamo 用定价统一 LLM GPU 路由
多位技术作者近日集中拆解了 NVIDIA Dynamo 的 LLM GPU 路由机制,结论相当一致:它不是“哪张卡记住了 prompt 就发给哪张卡”,而是把排队工作量、运行占用和缓存复用统一折算成一个总成本。路由器最终只需比较每块 GPU 的单一分数,选择成本最低者。值得关注的原因在于,这种“价格而非规则”的设计,试图同时兼顾缓存命中与全局负载均衡,避免单卡因“最会记忆”而被持续压垮。
已确认
- @Abhishekcur 与 @toddhooper 的拆解都指出,公式第一项衡量的不是“这个新请求本身要读多少”,而是目标 GPU 还欠着多少未完成读取工作:包括已接单但尚未完成的请求,再加上这次新请求带来的新增读取量。
- 第二项是 空间/占用。按 @Abhishekcur 的说法,它统计的是当前正在运行的工作已经占用的资源,以及新请求还会额外占用多少;这个量与“缓存里是否已经记住 prompt”是分开计算的。
- 对缓存复用,Dynamo 采用 分层定价 而非硬规则:缓存仍在 GPU 上时复用成本最低、折扣最大;在普通内存里时折扣更小;落到磁盘时折扣最小。
- 以上维度都会被统一换算成同一量纲——cache block。这样每块 GPU 都能被压缩成一个总成本分数,路由器无需多重分步判断,只需把请求发给分数最低的 GPU。
- @Abhishekcur 还强调,这个缓存折扣不是从 0 开始算,而是相对当前最空闲的可选 GPU来计算;同时,排队长度也是按请求自身大小衡量,而不是用固定阈值。
为什么重要
- 多位作者都指出,传统的 prompt/KV locality 路由有一个典型失效模式:如果一味把请求发给“已经记住 prompt”的那张卡,这张卡会因为命中率高而不断接到更多请求,最终比其他 GPU 更早被压满。
- Dynamo 的思路是把“记忆优势”变成一种会随排队情况变化的折扣,而不是绝对优先级。随着某块 GPU 队列拉长,它的缓存优势会相对衰减,请求就更容易流向更空闲、总成本更低的 GPU。
- 对多 GPU 的大模型推理服务来说,这意味着缓存复用不再是孤立优化项,而是与排队和占用一起进入统一决策,尽可能在吞吐、时延和资源利用之间做全局权衡。
2026-07-27 ~ 2026-07-28 · 14 条相关
一手来源
- 拆解 NVIDIA Dynamo 路由设计:用单一指标解决 GPU 负载与缓存 — Abhishekcur ·
- Dynamo 按未完成读工作量给 GPU 打分 — toddhooper ·
- LLM 推理路由新视角:Dynamo 为何不把请求发给记住 prompt 的 GPU — _jaydeepkarale ·
- 【源头】Dynamo 按未完成读工作量给 GPU 打分 — toddhooper · 2026-07-27
- Dynamo 说明只看 prompt 记忆会压垮单块 GPU — Abhishekcur · 2026-07-27
- Dynamo 把每块 GPU 的路由问题压成一个总成本 — Abhishekcur · 2026-07-27
- Dynamo 对 GPU、内存和磁盘缓存分别定价 — Abhishekcur · 2026-07-27
- Dynamo 把占用空间和缓存记忆分开计算 — Abhishekcur · 2026-07-27
- Dynamo 不是按 prompt 记忆路由,而是算总成本 — Abhishekcur · 2026-07-27
- GPU 路由用队列感知的记忆折扣,而不是固定复用规则 — Abhishekcur · 2026-07-27
- Dynamo 不再把请求路由给“记得 prompt 的 GPU” — Abhishekcur · 2026-07-28
- GPU 调度器按未完成任务估算排队读取工作量 — Abhishekcur · 2026-07-28
- Kimi K3 通过相对队列折扣提升 GPU 负载均衡 — Abhishekcur · 2026-07-28
- 【源头】拆解 NVIDIA Dynamo 路由设计:用单一指标解决 GPU 负载与缓存 — Abhishekcur · 2026-07-28
- Dynamo 架构解析:将内存转化为定价以优化 GPU 路由 — Abhishekcur · 2026-07-28
- 【源头】LLM 推理路由新视角:Dynamo 为何不把请求发给记住 prompt 的 GPU — _jaydeepkarale · 2026-07-28
另有 1 条近重复转述:Abhishekcur