CoreWeave 推理负责人拆解:Agent 请求 80-90% 输入重复,缓存决定架构
AI Engineer · youtube · 2026-09-20
CoreWeave 推理负责人 Sitanshu Gupta 在 AI Engineer 演讲中系统讲解推理平台从 MVP 到万亿参数负载的架构取舍。
核心洞察:Agent 类请求约 80-90% 的输入与上一次相同,而 prefill 是推理栈中最昂贵的环节——这正是缓存 token 定价远低于新 token 的原因,也塑造了平台的几乎所有设计。
两种消费模式:
- Serverless:按 token 计费,用户不见硬件;另设 provisioned throughput 层给流量可预期的客户,避免 noisy neighbor
- Dedicated:按 GPU 小时计费,走私有网关,客户自选引擎、决定 prefill/decode 是否分离
四种负载像俄罗斯方块拼合:Agent 与 chat 输入长输出短,但 agent 无人在回路、延迟预算极小;语音视频是流式延迟敏感型;批量客户给 12 小时的活随时可跑——因此白天服务实时流量的独享算力可夜间排空批量队列。
关键工程细节:路由器优先 KV cache 局部性、次选负载最低;对话间隙 KV cache 卸载到高带宽存储而非驱逐,避免重复 prefill。近期两大杠杆是 4-bit 量化和用客户自有数据异步训练的投机解码器。
「Infra」频道最新
- Nscale 营收暴涨 1252%,半年仍亏超 10 亿美元 — TansuYegen · 2026-09-20
- 开源 HilbertRaum:把本地模型、文档和聊天全装进一根 U 盘 — Vladowski · 2026-09-20
- 用 Jev 做实体消解:成本降 99.56%,吞吐升 7.35 倍,附 prompt 与踩坑 — hrishioa · 2026-09-20
- 搭 8 卡 RTX 6000 Pro 工作站?成本已够全款买公寓 — TheZachMueller · 2026-09-20
- Datawhale 联手 SGLang 开源推理引擎课程再添两章 — ying11231 · 2026-09-20
- Baseten 工程师复盘:投机解码成推理优化最快战场 — AI Engineer · 2026-09-20