KVMem 论文实现百万 token 工作区 KV 虚拟化
arXiv 论文 KVMem 提出一种 KV 上下文虚拟化方法:不将旧上下文压缩为摘要或重新检索文本,而是把溢出的 KV 状态分页保存于 GPU 显存、内存和 NVMe 上,需要时按注意力索引取回,从而保留模型已完成的计算。借助该方案,Agent 工作区可扩展至百万 token 级别,且在消费级 GPU 上即可运行。
2026-09-23 ~ 2026-09-23 · 2 条相关
- KVMem 用 KV 分页把 Agent 工作区扩展到百万 token,消费级 GPU 可跑 — rohanpaul_ai · 2026-09-23
- arXiv 论文 KVMem:在消费级 GPU 上虚拟化百万 token Agent 工作区 — rohanpaul_ai · 2026-09-23