LLM 推理路由新视角:Dynamo 为何不把请求发给记住 prompt 的 GPU

_jaydeepkarale · x · 2026-07-28

作者在做 LLM 推理方向的深挖,并点出一个常见误解:很多人以为 KV 路由就是把请求发给“已经记住你 prompt 的那块 GPU”。

他随后强调,Dynamo 并不是这么做的,而且“不这么做”的原因才是整套设计里最值得看的地方,暗示后文会展开讲推理路由/调度的关键思路。

所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →