Dynamo 说明只看 prompt 记忆会压垮单块 GPU
Abhishekcur · x · 2026-07-27
只按 prompt 记忆路由,会把最强 GPU 先压垮
这条 thread 一开始就指出了 KV routing 的一个经典失败模式:
- 如果所有请求都从同一个很长的 system prompt 开始,最先回复的 GPU 就会记住这段 prompt。
- 朴素做法会把后续请求继续发给这块“记住了 prompt”的 GPU。
- 结果是缓存越好,流量越集中,形成正反馈。
- 最后变成一块 GPU 被淹没,其他 GPU 明明也缓存着同样的 prompt,却闲着不用。
作者的结论是:只看“谁记住了 prompt”远远不够,必须同时权衡记忆、排队和容量。
所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→
「Infra」频道最新
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23