Dynamo 按未完成读工作量给 GPU 打分
toddhooper · x · 2026-07-27
路由公式第一项算的是“欠下的读工作量”
这部分解释 Dynamo 公式里的第一项:不是你的请求本身有多大,而是目标 GPU 还欠多少读取工作。
- 包括它已经接下但还没完成的请求。
- 再加上你这个请求会带来的新增工作。
所以系统问的不是“你有多大”,而是“你将站到多长的队伍后面”。这也是它更像负载均衡器,而不是简单查表路由器的原因。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23