为 OpenCode 写缓存友好压缩插件,本地模型提速近 10 倍

schennardo · reddit · 2026-09-23

作者发布了开源插件 opencode-cache-compact,解决 OpenCode 默认上下文压缩机制的痛点:默认压缩会从头剥离 token(含系统提示、工具定义),对托管模型无碍,但在本地模型上会导致整段已缓存会话被重新 prefill。

插件的做法是保留原始会话,让模型先写一份摘要,再把会话改写为「系统提示 + 工具 + 摘要」——由于完整会话仍在 KV 缓存中,压缩过程极快:在 Strix Halo 上从原本超过 10 分钟降到约 1-2 分钟。这是作者在本地 LLM 领域的第一个开源项目,正在征集反馈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →