GPU 路由用队列感知的记忆折扣,而不是固定复用规则
Abhishekcur · x · 2026-07-27
这段在讲一个用于 GPU 路由的调度技巧:记忆复用不是硬规则,而是会根据排队情况动态打折。
- 当某块 GPU 的队列越长,记忆带来的优势就会越小。
- 但这个“队列长度”不是拿来和 0 比,而是和你本来可以发送到的最空闲 GPU相比。
- 这意味着:当前最空闲的 GPU 会一直保留完整优势。
- 队列长度还会和请求本身的大小比较,所以大请求能接受更长等待,而小请求则更容易被导向别处。
- 这个设置默认关闭,适合“想复用,但不能为了复用付出任何代价”的场景。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23