Spomin:在 KV cache 里实时压缩上下文,500k 源 token 压进 180k 驻留

wgaca2 · reddit · 2026-09-11

开发者发布实验性工具 Spomin:一个位于 harness 与运行时之间的 router,直接在 KV cache 中把历史 chunk 替换为摘要,让长会话无需反复停机做全量压缩与重处理。配套开源了 llama.cpp 手术式改缓存的 fork。

工作原理

效果

限制

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →