Spomin:在 KV cache 里实时压缩上下文,500k 源 token 压进 180k 驻留
wgaca2 · reddit · 2026-09-11
开发者发布实验性工具 Spomin:一个位于 harness 与运行时之间的 router,直接在 KV cache 中把历史 chunk 替换为摘要,让长会话无需反复停机做全量压缩与重处理。配套开源了 llama.cpp 手术式改缓存的 fork。
工作原理
- 保留原始 transcript 分块存储,cache 中划分系统提示、近期上下文、摘要、生成与召回区。
- 独立 worker 进程生成摘要(可并行跑在另一台机器,或穿插在主模型生成间隙)。
- 空间不足时把符合条件的 chunk 替换为摘要,并调整主模型和受支持 draft cache 的 RoPE 位置;保留的后缀不做重新 prefill,只处理插入的摘要。
- 能识别 harness 重发的历史,只处理新内容;支持会话内暂停/恢复原生生成进行滚动维护;原文可按 context ID 临时召回或搜索更早历史。
效果
- 约 10:1 压缩:400k 源 token 变 40k 摘要,加上 20k 系统提示和 120k 近期上下文,相当于 180k 驻留 token 容纳 500k+ 源材料。
- 基准(探索性):Tetris 任务质量基本持平(16/16+11/12 vs 16/16+12/12),用时 69.8 分钟 vs 149.6 分钟,token 少 22.6%;Research 任务受 3 小时限制未完整对比,managed 成绩 37/100 vs unmanaged 57,但主模型输入少 75.2%、活跃时间少 60.7%。
限制
- 仅在 Qwen 3.8 27b 上测试,Qwen 3 系架构应可运行;新 Qwen 4 架构、MTP 不支持。worker 当前是微调的 Qwen2.5 3B 概念验证,也测了 Qwen3.5 9B。实验性软件,建议保持默认设置,摘要不会总保留关键细节。
「Infra」频道最新
- Oracle Q1 云基建收入三位数增长,AI 算力需求持续爆发 — DavidLinthicum · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11