SparseEngine 稀疏优先推理引擎:KV 驱逐下吞吐超 10 倍,Agent 场景提速 2 倍

Jitai Hao · hf · 2026-10-09

针对长上下文 Agent 的 KV-cache 内存与注意力计算压力,SparseEngine 从零构建为「稀疏优先」的推理引擎:通过共享生命周期契约,让每种稀疏注意力方法自控 KV 表示与计算,同时与通用 serving 基础设施协调状态转换。支持 4 大类共 15 种方法。

亮点包括 Chain Cache(从保留历史恢复 KV 驱逐方法的跨请求状态管理)和可控的前缀缓存剪枝。在保持方法质量的前提下,KV 驱逐场景吞吐超过 10 倍,同并发解码比 vLLM 快 2.5 倍以上,Agent 基准端到端提速 2 倍以上。代码已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →