AWS 大故障中作者靠多区切换,企业服务总停机仅 22 分钟

generativist · x · 2026-09-12

generativist 记录了 AWS 大规模故障当天与 Fable 维持企业服务的过程:通过跨可用区迁移(「yolo fail」式换端口换位置)、多套服务互为备份并绕过被关停的实例,全天总停机仅 22 分钟。

后续补充称服务恢复时间与其在 Twitter 上大声抱怨的时间点吻合,判断是 AWS 内部一套自动化系统进入了非常糟糕的状态。整体是一次少见的、公开的故障日容灾实战复盘。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →