p99 延迟基准可能在骗你:一篇长文讲透 coordinated omission
Franc0Fernand0 · x · 2026-09-11
作者发布延迟系列文章第二期,核心指出最常见的延迟测量方法——等每个响应返回再发下一个请求——会无意中与被测系统「协调」,掩盖真实尾部延迟,即 coordinated omission 问题。
- 典型例子:系统因 GC 暂停冻结 100ms,真实负载会堆积大量慢请求,但基准测试只记录一个请求就继续,p99 看起来很漂亮却是假象
- 文章还覆盖延迟方差的来源(CPU 缓存到垃圾回收器)、延迟如何在跨服务调用中复合
- 附带一个可运行的小型 ping 工具,测量自己网络的真实尾部延迟
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11