哈佛研究:LLM 服务缓存效率受流量模式影响
rohanpaul_ai · x · 2026-08-18
哈佛与芝加哥大学联合研究分析了 61.2 亿个请求、跨越 9174 个模型的一年生产数据。
主要发现:
- 可复用性高:99% 的上下文复用发生在 15 分钟内,用户常在短时间内返回同一模型处理增长上下文。
- 调度策略需优化:简单的负载均衡可能破坏 KV Cache 复用优势,应考虑请求历史。
- 流量动态变化:模型热度随月度变化,新用户输入更长,输出变短。
结论:现有的合成基准测试无法反映长期生产环境,路由、缓存和容量规划应基于真实流量的历史和结构。
「Infra」频道最新
- 五台 DGX Spark 全天跑 vLLM 发热,元凶不是 GPU — EAccelerate_42 · 2026-08-18
- 单透镜实现超快傅里叶变换与光学 AI — MeasurementDull7350 · 2026-08-18
- 开发者构建OpenRouter推理提供商市场份额仪表盘 — Ronangmi · 2026-08-18
- 从零推导构建 PyTorch 分布式训练框架 — hkproj · 2026-08-18
- Rebellions高管解析主权AI三大支柱:基建、数据与专业知识 — DavidBennett__ · 2026-08-18
- Qwen 本地推理配置指南:控制思考开销 — Altruistic_Heat_9531 · 2026-08-18