Dynamo 把 GPU 路由统一成一个缓存分数而非多重规则
Abhishekcur · x · 2026-07-28
这组长帖在讲一个 GPU 路由系统的核心设计:把排队、缓存复用、运行时占用空间都换算成同一种单位,再用一个总分决定把请求发到哪块 GPU。
核心思路
- 不再采用“先看缓存命中,再看负载”这种分步骤规则。
- 而是把所有因素都折算成cache block,每块 GPU 只得到一个总分。
- 路由器最终只需选出分数最低的 GPU。
这个总分怎么构成
- 排队工作量:不是看请求本身有多大,而是看这块 GPU 还欠多少没做完的工作。
- 空间占用:看当前正在运行的请求已经占了多少,以及新请求会额外占多少。
- 记忆复用:会变成折扣,但折扣大小取决于缓存放在哪:
- 在 GPU 上:折扣最大
- 在主机内存里:折扣更小
- 在磁盘上:折扣更小
关键细节
- 复用 prompt 会让这台 GPU 更便宜,但不意味着路由器无视排队负载。
- 缓存命中之所以有价值,是因为它既省读取时间,也减少新占用空间;但前提仍是这台 GPU 还有余量。
这条帖子的本质是在解释:Dynamo 不是靠一堆经验规则调度,而是把路由问题统一成一个优化问题来算。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23