开源 DKV 框架压缩本地长上下文推理的 KV 缓存
Om_5000 · reddit · 2026-07-25
DKV(DifferentialKV) 是一个面向长上下文本地 LLM 推理的开源 KV-cache 压缩框架。
项目目标是降低 KV 缓存占用,方案包括:
- 基于 anchor 的表示
- 联合低秩压缩
- 精确残差保留
- 稀疏路由注意力
仓库目前包含 CLI、MLX 后端、正在验证中的 CUDA 后端、一份技术报告以及完整开源实现。作者希望获得架构、benchmark 和与 llama.cpp / vLLM / SGLang 等项目集成方面的反馈。
所属事件:开源DKV框架压缩KV缓存,优化本地长文本推理(2 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11