KVMem 用 KV 分页把 Agent 工作区扩展到百万 token,消费级 GPU 可跑
rohanpaul_ai · x · 2026-09-23
论文提出 KVMem:不把旧上下文压缩成摘要或重新取回文本,而是把溢出的 KV 状态分页保存在 GPU 显存、内存和 NVMe 上,需要时按注意力索引取回,保留模型已完成的计算。
- DeepSWE + Qwen3.8-27B 上,Pass@1 从纯压缩方案的 43.8% 提升到 48.4%
- 历史恢复速度比 Compact+RAG 快 11.4–53.8 倍
- 在 24GB RTX 5090 笔记本 GPU 上支持约 100 万 token 的工作区,约 50 tokens/s(每步仍只看有限切片,非百万 token 全量提示)
所属事件:KVMem 论文实现百万 token 工作区 KV 虚拟化(2 条相关)→
「编程与Agent」频道最新
- 斯坦福发布 Terminal-Bench-Science:70 项科学任务最强模型仅解出 30% — geoffwolfe · 2026-09-23
- Moda 周报:用 Jev 捕捉更细信号,读完整对话找长跑 Agent 失误 — KlausCodes · 2026-09-23
- 两三条 Prompt 让 Opus 5.5 生成灯笼节水景大场面 — Silver-Chipmunk7744 · 2026-09-23
- stuntd:本地 22ms 学你流量的 Jev 兼容决策代理 — Inevitable-Log5414 · 2026-09-23
- 模型挂了 Agent 就得死?他花几个月造出状态持久化层 Metriqual — its_vayishu · 2026-09-23
- 给 Sonos MCP 服务器换上 OAuth 后的两个意外发现 — Mean-Gazelle5347 · 2026-09-23