KVMem 用 KV 分页把 Agent 工作区扩展到百万 token,消费级 GPU 可跑

rohanpaul_ai · x · 2026-09-23

论文提出 KVMem:不把旧上下文压缩成摘要或重新取回文本,而是把溢出的 KV 状态分页保存在 GPU 显存、内存和 NVMe 上,需要时按注意力索引取回,保留模型已完成的计算。

所属事件:KVMem 论文实现百万 token 工作区 KV 虚拟化(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →