LLM推理KV Cache架构演进与重构

随着大模型注意力模式日益复杂,KV Cache管理已成为推理系统中最棘手的难题之一,亟需社区持续迭代与互相借鉴。以TokenSpeed为代表的系统近期对其调度器进行了深度重构,放弃了原有的Radix Tree内存池设计,全面转向flat与block-based的架构。这一转变反映了当前底层基础设施在应对复杂推理需求时,正加速向更高效、灵活的内存管理方案演进。

2026-07-17 ~ 2026-07-17 · 2 条相关