KVMem 把上下文溢出存为分页 KV 状态,Agent 成功率反超压缩方案

omarsar0 · x · 2026-09-09

推文介绍了一篇提升推理效率的新论文 KVMem,解决的核心痛点是:长时间运行的 Agent,其工作区会在任务完成前远超上下文窗口。

作者对比了现有两类方案的缺陷:压缩(compaction)会丢失细粒度的执行证据;文本检索则会把模型已处理过的内容重新塞回上下文。

KVMem 的做法:

效果:在 DeepSWE 长上下文测试上用 Qwen3.8-27B,任务成功率从压缩方案的 43.8% 提升到 48.4%。

本地部署同样亮眼:在配备 24GB RTX 5090 的笔记本上运行 Qwen3.6/3.8-27B NVFP4 量化加 MTP,虚拟化出超长上下文。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →