Google/NVIDIA 联手开源项目,让 K8s 适配 LLM 推理
SumitGup · x · 2026-08-28
由 Google、NVIDIA、IBM 和 Red Hat 支持的开源项目 llm-d 旨在解决 Kubernetes 环境下 LLM 推理的性能瓶颈。
核心问题:传统 K8s Service 的轮询负载均衡会破坏 LLM 推理的 KV Cache 复用机制,导致每个请求都需要从头计算上下文,浪费算力。
解决方案:llm-d 通过自定义调度策略,确保带有相同前缀的请求被路由到已缓存相应 KV Cache 的实例上,从而大幅提升推理吞吐和效率。项目已在 GitHub 开源并获得 4.2k Star。
「Infra」频道最新
- 设计可靠 LLM 网关:构建后端统一可信入口 — Mahmoud_Zalt · 2026-08-28
- LightGlue 推 ONNX 版:支持 TensorRT 与跨平台部署 — rsasaki0109 · 2026-08-28
- LLM 三次逃逸 VM,研究者重申沙箱需攻击面减缩 — dyn___ · 2026-08-28
- Cloudflare 工程师:如何构建 LLM 时代可扩展软件 — 新智元 · 2026-08-28
- 国产大模型算力底座曝光:18B 激活 MoE 训练 30T token — teortaxesTex · 2026-08-28
- 澳洲能源部长:数据中心无化石燃料豁免权 — nordicinst · 2026-08-28