NVIDIA Dynamo 用定价统一 LLM GPU 路由

多位技术作者近日集中拆解了 NVIDIA Dynamo 的 LLM GPU 路由机制,结论相当一致:它不是“哪张卡记住了 prompt 就发给哪张卡”,而是把排队工作量、运行占用和缓存复用统一折算成一个总成本。路由器最终只需比较每块 GPU 的单一分数,选择成本最低者。值得关注的原因在于,这种“价格而非规则”的设计,试图同时兼顾缓存命中与全局负载均衡,避免单卡因“最会记忆”而被持续压垮。

已确认

为什么重要

2026-07-27 ~ 2026-07-28 · 14 条相关

一手来源

另有 1 条近重复转述:Abhishekcur