vLLM 生产环境坑:GPU 故障可致 K8s 节点报废,推理是有状态负载

tianyin_xu · x · 2026-10-09

开发者 MadhavJivrajani 发 PSA 提醒:在 K8s 上生产使用 vLLM 时,某些 GPU 故障会让整个节点基本不可用——即使没有 KV cache,推理也是非常「有状态」的工作负载。对应修复已以 PR #57635 合入 vLLM 主分支。

该 PR 修复一个 autotune 缓存死锁 bug:flashinferautotune 只持久化 rank 0 的缓存并在下次启动时广播,但 FlashInfer 按 tprank/eprank 键控持久化条目,导致只有 rank 0 能命中缓存;命中会跳过同步调优的 reduce 步骤,rank 1..N-1 阻塞在 reduce、rank 0 在末尾 barrier 自旋,直到 30 分钟超时。触发场景:缓存目录在 pod 生命周期卷上的容器重启,或持久化存储上的第二次引擎启动。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →