开源 DKV 压缩 KV Cache,瞄准本地长上下文推理
Om_5000 · reddit · 2026-07-25
- DKV(DifferentialKV) 是一个面向 长上下文本地 LLM 推理 的开源 KV-cache 压缩框架。
- 它采用 基于 anchor 的表示、联合低秩压缩、精确残差保留 和 稀疏路由注意力 来降低内存占用。
- 项目当前提供了 CLI、MLX 后端、仍在验证中的 CUDA 后端、技术报告,以及完整开源实现。
- 作者希望获得关于架构设计、基准测试和与 llama.cpp / vLLM / SGLang 集成的技术反馈。
所属事件:开源DKV框架压缩KV缓存,优化本地长文本推理(2 条相关)→
「Infra」频道最新
- 苹果为平台 AI 补上 Swift 接口、MLX 与 agent 工作流 — rxwei · 2026-07-25
- Intel 消费级主板或破坏多 GPU 机器的 PCIe P2P — Arli_AI · 2026-07-25
- 一张 OIF 幻灯片称,scale-out 不必执着 CPO 省电 — zephyr_z9 · 2026-07-25
- 开源 DKV 框架压缩本地长上下文推理的 KV 缓存 — Om_5000 · 2026-07-25
- Kimi 权重若公开,争论会转向硬件经济学对 V4 — teortaxesTex · 2026-07-25
- 黄仁勋在 Starbase 交付桌面级 DGX Spark — XFreeze · 2026-07-25