复用连接把 LLM 调用前预算检查 p99 从 1278ms 降到 414ms

Tough_Stretch_4045 · reddit · 2026-09-23

一位独立开发者实测自己部署在 us-east-1 的 LLM 调用前预算检查服务(每次调用前的 Redis 读写,判断用户是否超预算):

差距几乎全部来自 TCP+TLS 握手:冷连接 TCP 约 156ms、TLS 约 315ms,请求还没发出;热连接地板约 253ms,基本是物理距离。

意外发现:响应的 cf-ray 后缀是 MRS——他从印度发出的请求经 Cloudflare 马赛边缘节点路由,而非孟买/金奈,部分'距离成本'来自套餐内无法控制的路由。客户端 2 秒超时后放行 LLM 调用,最坏情况是未检查的调用而非拦截用户。作者向其他做 gateway/guardrail/限流的人询问可接受的延迟与是否把检查移到调用之后。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →