SparseEngine 稀疏优先推理引擎:KV 驱逐下吞吐超 10 倍,Agent 场景提速 2 倍
Jitai Hao · hf · 2026-10-09
针对长上下文 Agent 的 KV-cache 内存与注意力计算压力,SparseEngine 从零构建为「稀疏优先」的推理引擎:通过共享生命周期契约,让每种稀疏注意力方法自控 KV 表示与计算,同时与通用 serving 基础设施协调状态转换。支持 4 大类共 15 种方法。
亮点包括 Chain Cache(从保留历史恢复 KV 驱逐方法的跨请求状态管理)和可控的前缀缓存剪枝。在保持方法质量的前提下,KV 驱逐场景吞吐超过 10 倍,同并发解码比 vLLM 快 2.5 倍以上,Agent 基准端到端提速 2 倍以上。代码已开源。
「Infra」频道最新
- GitHub Copilot 将支持本地模型智能路由,帮用户省 AI 额度 — lee_stott · 2026-10-09
- 4090 单卡跑 27B 模型:262K 上下文 + 130 tok/s — Distinct-Pie2389 · 2026-10-09
- 20 秒起 250 台 VM 跑 Agent 沙箱,成本仅 10 美分 — RexDouglass · 2026-10-09
- 缓存命中≠免费:拆解 Triton 编译缓存的双生命周期与隐性成本 — Mahmoud_Zalt · 2026-10-09
- AI 智能体将催生史上最大官僚系统:机器为机器打工 — brucemacv · 2026-10-09
- Bittensor 上的 GPU 云 Lium 半年回购销毁近 270 万美元 SN51 代币 — markjeffrey · 2026-10-09