OpenLake 用外部 KV 缓存卸载把长上下文成本砍半

arnav__1 · hn · 2026-07-26

OpenLake 说自己把大模型的 KV cache 从 GPU 显存卸载到共享 RAM/NVMe 后,能把长上下文推理成本几乎砍半。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →