p99 延迟基准可能在骗你:一篇长文讲透 coordinated omission
Franc0Fernand0 · x · 2026-09-11
作者发布延迟系列文章第二期,核心指出最常见的延迟测量方法——等每个响应返回再发下一个请求——会无意中与被测系统「协调」,掩盖真实尾部延迟,即 coordinated omission 问题。
- 典型例子:系统因 GC 暂停冻结 100ms,真实负载会堆积大量慢请求,但基准测试只记录一个请求就继续,p99 看起来很漂亮却是假象
- 文章还覆盖延迟方差的来源(CPU 缓存到垃圾回收器)、延迟如何在跨服务调用中复合
- 附带一个可运行的小型 ping 工具,测量自己网络的真实尾部延迟
「Infra」频道最新
- 腾讯参投的燧原科技上海上市首日暴涨 179%,募资 9.1 亿美元 — pstAsiatech · 2026-09-11
- Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开 — whiteh4cker · 2026-09-11
- Qdrant 宣布三场免费社区活动:4 小时向量技术长直播压轴 — qdrant_engine · 2026-09-11
- 国内 B300 现货喊到 1600 万一台,3 倍溢价把国产卡推成推理最优解 — aigclink · 2026-09-11
- 实测:RunPod 自托管 Qwen 27B 生成仅 17 tok/s,长输出成本反输 OpenAI — yeah280 · 2026-09-11
- vLLM 详解 MiniMax M3 在 AMD MI355X 上的调优:单卡吞吐提升至 4.45 倍 — vllm_project · 2026-09-11