61 亿请求LLM服务追踪分析:缓存策略与负载均衡研究
JiaZhihao · x · 2026-08-22
基于 Chutes.ai 一年生产环境追踪数据(61 亿请求、31.5 万用户、9174 个模型),论文深入分析了 LLM 服务工作负载的演变。
核心发现:
- 工作负载随时间显著变化,输入变长,输出变短。
- Prefix 重用具有极强的时间局部性:99% 的重复发生在 15 分钟内。
- 简单的 FIFO/LRU 缓存策略可匹敌或击败更复杂的策略。
- 缓存与负载均衡紧密耦合:保留 KV 局部性可能与副本间的负载均衡冲突。
「Infra」频道最新
- 为何 Claude Code 非开源?呼吁拥抱开源 Harness — omarsar0 · 2026-08-22
- llmaker:一条命令从终端自托管整套现代 LLM 服务栈 — raiyanyahya · 2026-08-22
- MCP 可替代 RAG 接入本地知识库吗? — vick2djax · 2026-08-22
- 微软打造 FinOps 控制面,Agent 成本降 78% — AI Engineer · 2026-08-22
- 建 AI 超算集群应像深圳:集中在能源富集地 — MatthewChang · 2026-08-22
- 清华等推 PhyAI 引擎:统一云端与边缘端物理 AI 推理 — jiqizhixin · 2026-08-22