Dynamo 把每块 GPU 的路由问题压成一个总成本
Abhishekcur · x · 2026-07-27
Dynamo 把排队、占用和缓存统一成一个分数
这段 thread 的核心技巧是:不再把排队、占用空间、缓存命中拆成几个独立决策。
- 三者都被统一换算成同一个单位:cache block。
- 一旦统一量纲,每块 GPU 就只剩一个分数。
- 路由器直接选分数最小的那块。
也就是说,它不是“先看内存,再看负载”,而是先把所有成本合并成一个统一的目标函数。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23