vLLM 生产环境坑:GPU 故障可致 K8s 节点报废,推理是有状态负载
tianyin_xu · x · 2026-10-09
开发者 MadhavJivrajani 发 PSA 提醒:在 K8s 上生产使用 vLLM 时,某些 GPU 故障会让整个节点基本不可用——即使没有 KV cache,推理也是非常「有状态」的工作负载。对应修复已以 PR #57635 合入 vLLM 主分支。
该 PR 修复一个 autotune 缓存死锁 bug:flashinferautotune 只持久化 rank 0 的缓存并在下次启动时广播,但 FlashInfer 按 tprank/eprank 键控持久化条目,导致只有 rank 0 能命中缓存;命中会跳过同步调优的 reduce 步骤,rank 1..N-1 阻塞在 reduce、rank 0 在末尾 barrier 自旋,直到 30 分钟超时。触发场景:缓存目录在 pod 生命周期卷上的容器重启,或持久化存储上的第二次引擎启动。
「编程与Agent」频道最新
- 微软老将谈 vibe coding 边界:AI 能写代码,但架构判断仍离不开人 — mjuric · 2026-10-09
- shadcn谈AI时代最重要的编码技能:别让Agent替你读 — shadcn · 2026-10-09
- Philosopher Skill:一条 prompt 把任意领域变成可调深度的学习页面 — holyshitthatsucks · 2026-10-09
- Codex 被限速至 5 tok/s,博主称本地模型部署才是正解 — lxfater · 2026-10-09
- LangChain 创始人评 Jev 评测法:轨迹标注应拆成多个独立问题作答 — hwchase17 · 2026-10-09
- 开发者用 Claude 两周在 Rust 上复刻七款 Adobe 应用,版权争议四起 — technollama · 2026-10-09