哈佛发布 6.12 亿级 LLM 推理数据集:一年 61.2 亿次生产请求全开放
airesearch12 · x · 2026-09-20
哈佛 SEAS MadSys 实验室联合 Chutes、FreeInference 公开一整年的 LLM 推理服务元数据追踪数据集,共 61.2 亿次请求、覆盖 9,174 个模型,包含请求到达时间、输入/输出 token 数、缓存命中、TTFT 等,并附论文与代码,面向真实服务负载研究、调度与基础设施优化。
已发布的数据集:
- A Year in LLM Serving:Chutes 一年生产请求轨迹(模型使用、token 量、前缀缓存复用);userid 每三个月轮换
- GPU 与服务遥测:GPU 和推理引擎时间序列
- 即将推出:Chutes 对话/角色扮演数据集、agent 服务数据(块哈希、时序、工具调用)与原始 prompt 数据集
初步发现:
- 请求时间局部性极强:同一用户对同一模型的重复请求 99% 在 15 分钟内到达
- 简单的 LRU 缓存淘汰策略常与复杂策略相当甚至更优
- 缓存感知路由可提升 token 命中率,仿真中带来 5–7% 负载不均衡
「Infra」频道最新
- Google AX 目标:现有资源跑 10-20 倍 Agent 沙箱 — rakyll · 2026-09-20
- 中国 CXMT 宣布新内存芯片平台进入量产 — johnnyApplePRNG · 2026-09-20
- 爆 OpenAI 算力告急,传闻引发行业关注 — ns123abc · 2026-09-20
- 一条脚本搞定本地 AI:模型+硬件+编码 Agent 预调优组合 — julianharris · 2026-09-20
- Google 开源 AX:为 Agent 工作负载重造的编排器 — rakyll · 2026-09-20
- 超频 CMP 170HX 显存带宽提升 36%,Qwen 27B 推理速度近乎翻倍 — Feralzi · 2026-09-20