OpenLake 用外部 KV 缓存卸载把长上下文成本砍半
arnav__1 · hn · 2026-07-26
OpenLake 说自己把大模型的 KV cache 从 GPU 显存卸载到共享 RAM/NVMe 后,能把长上下文推理成本几乎砍半。
- 他们指出,256K token 的 Gemma 4 31B 对话会产生约 43GB KV 状态,已经超过 80GB H100 的一半显存。
- 真正的痛点还在集群里:前缀缓存如果落在另一台 GPU 主机上,就得重新算一遍,整个集群的重复计算成本很高。
- 为了减少网络传输,OpenLake 做了 deferred materialization:
- KV 块离开 GPU 前先用自定义 CUDA kernel 无损压缩
- 取回后再在 GPU 上解压
- 他们给出的测试结果包括:
- 1.72× 无损 KV 压缩比
- H100 上约 600GB/s 解压吞吐
- 在物理 50GB/s 链路上实现约 80GB/s 的有效 KV 吞吐
- 128K 上下文下,TTFT 从 44 秒降到 0.6 秒
- 整体 GPU 时间从 1,169 秒降到 606 秒,节省 48.2% 的 GPU 成本
- 项目用 Rust 编写,底层用 iouring,并提供 vLLM 和 SGLang 连接器,方便直接接入现有推理栈。
「编程与Agent」频道最新
- 作者认为专门化 API 才是 AI Agent 变现关键 — eptwts · 2026-07-26
- 本地 AI 代理演示:会话同步、手机远控和工具调用都已可用 — SIGKITTEN · 2026-07-26
- Chrome 扩展涨价后,他用 Claude 15 分钟重做了一遍 — Delahuntagram · 2026-07-26
- ComfyUI 用 LTX 2.3 和 IC-LoRA 重建视频动作 — waterarttrkgl · 2026-07-26
- Codex 研究闲置二手价并自动生成上架列表 — kevinkern · 2026-07-26
- Codex app 被夸到“离谱”,设计和体验都更成熟了 — lucasmeijer · 2026-07-26