遥测服务致 K8s 控制平面过载,OpenAI 全线宕机复盘
techNmak · x · 2026-08-26
- 事故概览:2024 年 12 月 11 日,OpenAI 全线服务出现重大宕机,持续时间超过 4 小时。
- 根本原因:为提升可观测性而部署的新遥测服务引发意外后果。该服务导致数千节点疯狂请求 Kubernetes API 服务器,致使控制平面过载瘫痪。
- 连锁反应:DNS 缓存延迟了故障的显性化;更严重的是,损坏的控制平面恰恰是恢复操作所必需的组件,导致修复受阻。
- 恢复情况:ChatGPT 于 17:45 大幅恢复,API 于 17:36 大幅恢复,全线最终恢复于 19:38 (PST)。
- 技术启示:监控/遥测组件本身可能成为 DoS 攻击源;控制平面健康度与恢复能力需解耦;DNS 缓存可能掩盖初期故障。
「Infra」频道最新
- 曝 M5 Ultra 内存带宽 1.2TB/s,本地跑 Kimi 超 API — StefanoGogioso · 2026-08-26
- 数据中心反对潮并非源于反科技情绪 — AndyMasley · 2026-08-26
- AI代理安全市场争夺战:Zscaler能否成为企业安全默认控制面? — thedealdirector · 2026-08-26
- RTX 3060+2060 跑 Qwen 27B:仅 5-6 TPS 勉强可玩 — sheriffoftiltover · 2026-08-26
- PyTorch PR 修复 FSDP 模块静态特化问题 — ezyang · 2026-08-26
- 推理非投机:Token 消费不同于泡沫期硬件囤积 — AccBalanced · 2026-08-26