KV cache 分层卸载实战讨论:GPU→RAM→NVMe→S3 的代价与痛点
Responsible-You9024 · reddit · 2026-09-08
作者正在做自托管 LLM 推理的 KV-cache 卸载:把较冷的 KV 块按 GPU → RAM → NVMe → S3 分层下移,而不是全部占住昂贵的显存。他在社区征集生产环境的实战反馈:大家最大的痛点是显存容量、KV 回载时的延迟、网络带宽还是其他问题。适合正在做本地/大规模推理优化的工程师关注与参与讨论。
「Infra」频道最新
- Actian 新向量库自称比 Qdrant 快 22 倍,文档概念却与 Qdrant 如出一辙 — qdrant_engine · 2026-09-08
- 8GB 显卡本地跑 Flux 与 Wan 2.2:三个设置错误拖慢了渲染 — leonbuilds · 2026-09-08
- 供应链现实:Optimus 零部件离不开中国,人形机器人供应链中国主导 — JOBhakdi · 2026-09-08
- 实测对比:同模型下 Apple Core AI 与 MLX 谁更快 — HankYeomans · 2026-09-08
- D-Wave 与美商务部签约,获最高 1 亿美元 CHIPS 法案资金 — ceciletamura · 2026-09-08
- 出口管制见效?海外 H200 仅 280、B300 仅 450 的价格之问 — teortaxesTex · 2026-09-08