AWS 大故障中作者靠多区切换,企业服务总停机仅 22 分钟
generativist · x · 2026-09-12
generativist 记录了 AWS 大规模故障当天与 Fable 维持企业服务的过程:通过跨可用区迁移(「yolo fail」式换端口换位置)、多套服务互为备份并绕过被关停的实例,全天总停机仅 22 分钟。
后续补充称服务恢复时间与其在 Twitter 上大声抱怨的时间点吻合,判断是 AWS 内部一套自动化系统进入了非常糟糕的状态。整体是一次少见的、公开的故障日容灾实战复盘。
「Infra」频道最新
- Intel 光互连耦合器实测插损 1~1.5 dB,工艺良率瑕疵可见 — jwt0625 · 2026-09-12
- CPO 论文遭质疑:DLW 芯片与 PIC 耦合方式仅以「如 TCB 等」带过 — jwt0625 · 2026-09-12
- 全球数据中心耗电分布:美国占 43%,中国仅占 13% — TMWNN · 2026-09-12
- Intel 工程师实测共封装光学:V 型槽边缘耦合新方案 — jwt0625 · 2026-09-12
- Intel 工程师曝光晶圆级测试中的芯片封装检测现场 — jwt0625 · 2026-09-12
- 前 Google 工程师猜想:苹果或做 Apple Silicon 原生的下一 token 预测器 — yaroslavvb · 2026-09-12