语义缓存加校验要付多少延迟?作者实测:30-40ms,LLM 评审要 1.7 秒
Reasonable_Royal_621 · reddit · 2026-09-09
作者开发了 CacheVerifier,在语义缓存命中前对边界命中做二次校验,并实测了这道同步检查的真实延迟成本:
- 服务端:仅 2 vCPU 无 GPU 生产机上跑 300 次回环调用,校验模型本身 p50 约 17ms、p95 约 28ms;叠加 auth、租户查询、限流、序列化后达 30ms p50 / 41ms p95;再加 TLS 与反代一跳,整体约 33ms p50 / 44ms p95 / 47ms p99。
- 客户端视角:从美东机器对生产 API 发 150 次真实同步调用,热连接全程往返平均 33.5ms、p95 39.1ms,与零网络数字几乎相同。
- LLM 评审对比:若改用异步 LLM judge 做同类校验,平均要 1.7 秒,糟糕路径上仅网络握手就能吃掉半秒——同一种「先验证再信任」的思路,成本因后端架构而天差地别。
- 触发范围:校验只对边界命中触发,按相似度阈值不同约覆盖四分之一到过半流量。
核心问题:缓存命中本该是免掉数百毫秒到数秒 LLM 调用的快路径,往上面加 30-40ms 的同步税值不值,取决于错误命中下游代价多大。完整延迟报告见 repo 的 PAPER.md 第 5.5 节,该节已独立成论文。
「编程与Agent」频道最新
- 姚金刚开源大会运营系统 TokEMS,迭代 140 次覆盖报名到签到 — vista8 · 2026-09-09
- AI 规划能力越来越强,但复杂任务仍该写详细提示词分步走 — bendee983 · 2026-09-09
- Reddit 实战复盘:定时 Agent 崩溃恢复的关键不是对话日志而是结构化状态 — daani_maas · 2026-09-09
- DeepSeek 沙箱可被一条命令自关,漏洞 CVE-2026-82533 评分 9.4 — jedisct1 · 2026-09-09
- 3DHarnessBench:前沿 VLM 的 agentic 3D 转代码能力参差不齐 — ftm_guney · 2026-09-09
- Codex 接入 GPT Image 2.5:走订阅额度,无需另配 API Key — gabrielchua · 2026-09-09