CoreWeave 推理负责人拆解:Agent 请求 80-90% 输入重复,缓存决定架构

AI Engineer · youtube · 2026-09-20

CoreWeave 推理负责人 Sitanshu Gupta 在 AI Engineer 演讲中系统讲解推理平台从 MVP 到万亿参数负载的架构取舍。

核心洞察:Agent 类请求约 80-90% 的输入与上一次相同,而 prefill 是推理栈中最昂贵的环节——这正是缓存 token 定价远低于新 token 的原因,也塑造了平台的几乎所有设计。

两种消费模式:

四种负载像俄罗斯方块拼合:Agent 与 chat 输入长输出短,但 agent 无人在回路、延迟预算极小;语音视频是流式延迟敏感型;批量客户给 12 小时的活随时可跑——因此白天服务实时流量的独享算力可夜间排空批量队列。

关键工程细节:路由器优先 KV cache 局部性、次选负载最低;对话间隙 KV cache 卸载到高带宽存储而非驱逐,避免重复 prefill。近期两大杠杆是 4-bit 量化和用客户自有数据异步训练的投机解码器。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →