一组 LLM 缓存管理资源,覆盖 KV cache 与推理解码优化
gaganghotra_ · x · 2026-07-23
这条帖子整理了一组学习 LLM 缓存管理 的资源,覆盖 KV cache、prefix caching、continuous batching、speculative decoding 和 KV cache 量化等主题。
同时还列出几篇相关论文/系统工作,重点包括:
- FlashInfer:Attention 引擎
- Zipage:压缩版 PagedAttention
- IceCache:更节省内存的 KV cache 方案
「Infra」频道最新
- 光读出相变存储有 40 dB 损耗,2D VCSEL 阵列是亮点 — jwt0625 · 2026-07-23
- GPU 机柜正卡在冷板和 CDU 产能,而不是芯片供应 — tengyanAI · 2026-07-23
- Celeris 组建新实验室,押注微秒级响应的 LLM — timshi_ai · 2026-07-23
- Reddit 讨论:如何在 AI agent 跑飞前拦住账单 — Designer_Power3691 · 2026-07-23
- RunPod 用户获得一个可提醒并自动领取 pod 的 Chrome 扩展 — Particular-Repair895 · 2026-07-23
- MiniMax 称 MI355X 服务性能已接近 B200,覆盖 428B 多模态模型 — salykova_ · 2026-07-23