Dynamo 不是按 prompt 记忆路由,而是算总成本
Abhishekcur · x · 2026-07-27
Dynamo 用统一的缓存块指标做路由
这段 thread 解释了为什么 Dynamo 不是“谁记住了 prompt 就把请求发给谁”。
- 仅靠缓存命中,容易把请求越堆越多,最后把最会记忆的 GPU 也压垮。
- Dynamo 把三件事放进同一个单位里算:排队中的工作量、当前占用的空间、以及可复用的缓存收益。
- 路由器会为每块 GPU 算出一个总分,然后直接选最小的那个。
- 其中,缓存命中不是硬规则,而是一个折扣项:能复用就更便宜,但不必然优先。
核心结论是:prompt 记忆能降成本,但不能凌驾于整体负载之上。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23