Google/NVIDIA 联手开源项目,让 K8s 适配 LLM 推理

SumitGup · x · 2026-08-28

由 Google、NVIDIA、IBM 和 Red Hat 支持的开源项目 llm-d 旨在解决 Kubernetes 环境下 LLM 推理的性能瓶颈。

核心问题:传统 K8s Service 的轮询负载均衡会破坏 LLM 推理的 KV Cache 复用机制,导致每个请求都需要从头计算上下文,浪费算力。

解决方案:llm-d 通过自定义调度策略,确保带有相同前缀的请求被路由到已缓存相应 KV Cache 的实例上,从而大幅提升推理吞吐和效率。项目已在 GitHub 开源并获得 4.2k Star。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →