KVMem 论文实现百万 token 工作区 KV 虚拟化

arXiv 论文 KVMem 提出一种 KV 上下文虚拟化方法:不将旧上下文压缩为摘要或重新检索文本,而是把溢出的 KV 状态分页保存于 GPU 显存、内存和 NVMe 上,需要时按注意力索引取回,从而保留模型已完成的计算。借助该方案,Agent 工作区可扩展至百万 token 级别,且在消费级 GPU 上即可运行。

2026-09-23 ~ 2026-09-23 · 2 条相关