工程复盘:虚假的 100% 成功率与隐性延迟灾难
CupGlass540 · reddit · 2026-08-25
作者分享了在自建模型网关中排查故障的实战经验,揭示了看似完美的监控指标下隐藏的严重性能问题:
- 后端队列爆炸:移除并发限制后,网关返回 100% 成功率(HTTP 200),但实际上 31/32 的响应在客户端放弃后才到达,有效吞吐量极低。加上限制后,虽成功率降至 25%,但有效响应提升了 6 倍。
- 延迟失控的故障转移:故障转移逻辑仅检测后端是否存活,未考虑延迟。当后端响应变慢(3s)但未超时(Deadline 1.5s)时,系统持续调用慢后端,导致健康的后端从未被调用。修复方案是让请求拥有全局 Deadline,并限制单个后端只能消耗剩余时间的 60%。
- 性能瓶颈误判:作者本以为热点是数据库读取(实测仅 0.146ms),真正的瓶颈是指标行落盘(占 75% 时间),优化后耗时从 2.999ms 降至 0.230ms。
结论:成功率是掩盖故障的误导性指标,真正应关注的是“在用户还在等待时到达的有效响应数”。
「Infra」频道最新
- 4070 Ti 实测:Kimi K3、DeepSeek V4 本地推理性能报告 — JayB_Official · 2026-08-25
- 长鑫存储 LPDDR6 曝光:小米 XRING-03 首发 — teortaxesTex · 2026-08-25
- h3.c 新分支支持 3090 与多 GPU,新增 UI 界面 — QuixiAI · 2026-08-25
- 1 小时 AI 工作成本低于旧金山 1 分钟停车费 — stuffyokodraws · 2026-08-25
- Mac 端 Qwen 3.8 27B 提速实测:改用 Dflash2 后达 113 TPS — TheMoonMidas · 2026-08-25
- TileMix:基于块级混合精度的 LLM 推理加速 — Hanzhi Zhang · 2026-08-25