arXiv 论文 KVMem:在消费级 GPU 上虚拟化百万 token Agent 工作区
rohanpaul_ai · x · 2026-09-23
arXiv 论文《KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU》提出 KV 上下文虚拟化系统:将超出容量的 Agent 工作区历史以分页 KV 状态保存在 GPU 显存、主机内存与 NVMe 中,用模型原生的轻量注意力索引挑选相关历史块,并按查询生成受原生上下文窗口约束的「执行视图」。
- 相比压缩摘要式方案,保留细粒度执行证据,避免重复 prefill
- 在 LongMemEval、MemoryAgentBench、AgentLongBench 等百万 token 级基准上,任务效用与推理效率普遍优于压缩方案
- DeepSWE + Qwen3.8-27B:任务成功率从 43.8% 升至 48.4%
- 24GB RTX 5090 笔记本可运行 Qwen3.6/3.8-27B NVFP4 + MTP,虚拟化 4 倍于原生 256K 窗口的 1M token 工作区
所属事件:KVMem 论文实现百万 token 工作区 KV 虚拟化(2 条相关)→
「编程与Agent」频道最新
- Dolphin 作者造新语言 With:Rust 级安全、零样板的原生系统语言 — QuixiAI · 2026-09-23
- With 语言官网详解:28 秒空目录到原生窗口,C 库直接 import — QuixiAI · 2026-09-23
- 用 iOS 快捷指令+OpenRouter 给国区 iPhone 手搓视觉 Siri — alifcoder · 2026-09-23
- Reddit 用户吐槽 Agent 任务成本失控:缺预算上限与自动止损 — yi111 · 2026-09-23
- 安全审计显示:自主漏洞研究程序 XBOW 已修复约 12 个上游 bug — moyix · 2026-09-23
- 给 Agent 加一句「用形式验证找 bug」,代码质量显著提升 — sh_reya · 2026-09-23