开源 DKV 框架压缩本地长上下文推理的 KV 缓存
Om_5000 · reddit · 2026-07-25
DKV(DifferentialKV) 是一个面向长上下文本地 LLM 推理的开源 KV-cache 压缩框架。
项目目标是降低 KV 缓存占用,方案包括:
- 基于 anchor 的表示
- 联合低秩压缩
- 精确残差保留
- 稀疏路由注意力
仓库目前包含 CLI、MLX 后端、正在验证中的 CUDA 后端、一份技术报告以及完整开源实现。作者希望获得架构、benchmark 和与 llama.cpp / vLLM / SGLang 等项目集成方面的反馈。
「Infra」频道最新
- 开源 DKV 压缩 KV Cache,瞄准本地长上下文推理 — Om_5000 · 2026-07-25
- Intel 消费级主板或破坏多 GPU 机器的 PCIe P2P — Arli_AI · 2026-07-25
- 一张 OIF 幻灯片称,scale-out 不必执着 CPO 省电 — zephyr_z9 · 2026-07-25
- Kimi 权重若公开,争论会转向硬件经济学对 V4 — teortaxesTex · 2026-07-25
- 黄仁勋在 Starbase 交付桌面级 DGX Spark — XFreeze · 2026-07-25
- 小鹏人形机器人试产,Anthropic 也在推进自研芯片 — 创业邦 · 2026-07-25