Dynamo 把 GPU 路由统一成一个缓存分数而非多重规则

Abhishekcur · x · 2026-07-28

这组长帖在讲一个 GPU 路由系统的核心设计:把排队、缓存复用、运行时占用空间都换算成同一种单位,再用一个总分决定把请求发到哪块 GPU。

核心思路

这个总分怎么构成

关键细节

这条帖子的本质是在解释:Dynamo 不是靠一堆经验规则调度,而是把路由问题统一成一个优化问题来算。

所属事件:NVIDIA Dynamo 用定价统一 LLM GPU 路由(14 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →