开源 DKV 框架压缩本地长上下文推理的 KV 缓存

Om_5000 · reddit · 2026-07-25

DKV(DifferentialKV) 是一个面向长上下文本地 LLM 推理的开源 KV-cache 压缩框架。

项目目标是降低 KV 缓存占用,方案包括:

仓库目前包含 CLI、MLX 后端、正在验证中的 CUDA 后端、一份技术报告以及完整开源实现。作者希望获得架构、benchmark 和与 llama.cpp / vLLM / SGLang 等项目集成方面的反馈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →