KV cache 分层卸载实战讨论:GPU→RAM→NVMe→S3 的代价与痛点

Responsible-You9024 · reddit · 2026-09-08

作者正在做自托管 LLM 推理的 KV-cache 卸载:把较冷的 KV 块按 GPU → RAM → NVMe → S3 分层下移,而不是全部占住昂贵的显存。他在社区征集生产环境的实战反馈:大家最大的痛点是显存容量、KV 回载时的延迟、网络带宽还是其他问题。适合正在做本地/大规模推理优化的工程师关注与参与讨论。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →