KVMem 把上下文溢出存为分页 KV 状态,Agent 成功率反超压缩方案
omarsar0 · x · 2026-09-09
推文介绍了一篇提升推理效率的新论文 KVMem,解决的核心痛点是:长时间运行的 Agent,其工作区会在任务完成前远超上下文窗口。
作者对比了现有两类方案的缺陷:压缩(compaction)会丢失细粒度的执行证据;文本检索则会把模型已处理过的内容重新塞回上下文。
KVMem 的做法:
- 把溢出内容保留为分页的 KV 状态,分散存储在 GPU 显存、主机内存和 NVMe 上,而不是丢弃或转成文本
- 用模型原生的轻量级注意力空间索引挑选相关历史块,按查询动态物化出一个恰好塞进原生上下文窗口的视图
效果:在 DeepSWE 长上下文测试上用 Qwen3.8-27B,任务成功率从压缩方案的 43.8% 提升到 48.4%。
本地部署同样亮眼:在配备 24GB RTX 5090 的笔记本上运行 Qwen3.6/3.8-27B NVFP4 量化加 MTP,虚拟化出超长上下文。
「编程与Agent」频道最新
- Fuzz 测试自家 Rust Postgres,顺带挖出 20+ 个 Postgres 本体 bug — DanielLockyer · 2026-09-09
- 改用 CLI 跑 AI 后 Mac 续航骤降,可能是 agent 长驻耗电 — DanielLockyer · 2026-09-09
- 微软办 MCP Live! 四小时直播:GitHub、AWS、Anthropic 齐讲 MCP 服务器实战 — lee_stott · 2026-09-09
- Kent C. Dodds 发布 Kody:让 Claude Code、Cursor、Codex 之间的切换不再丢配置 — threepointone · 2026-09-09
- DaVinci Resolve 21.1 被视为 AI 视频编辑 Agent 的关键升级 — gabrielchua · 2026-09-09
- Frost 智能体自主立项:提出假设、链上记录推理并启动跨 GPU 基准 — Michael_Moroz_ · 2026-09-09