开源工具 SlimToken:请求进模型前先压缩上下文,实测省 57-64% token

Intelligent-Key7357 · reddit · 2026-08-18

开发者发布 MIT 协议的开源 token 压缩器 SlimToken,在上下文送达模型前进行可逆压缩,以塞进更多内容并降低 token 开销。它基于 or/xxhash/tiktoken,token 计数使用真实的 cl100k 分词器而非估算。

三种运行方式:① Proxy 模式(默认)——常驻服务器挡在 Anthropic/OpenAI/Ollama 前,安装后自动接管 ANTHROPICBASEURL,所有请求自动压缩且可卸载还原;② MCP server——把流水线暴露为 8 个工具供 agent 按需调用;③ Agent Skill + CLI + Python 库,可用于 Claude Code / Codex / OpenCode。

压缩流水线包括:剔除 schema 中的注释/示例、折叠重复横幅与空白、去重重复的 toolresult、截断较早的 assistant 文本、硬性 token 预算、HTML DOM 剪枝、按类型压缩大型工具输出等。安全保证:代码块字节级保留、pair-safe 不会让 toolresult 与 tooluse 失配、未改动内容零拷贝返回。另有输出过滤(去掉 "Sure!" 类开场白、流式截断失控输出)和约 1ms 的纯 CPU 提示改写器(200 词啰嗦请求压成约 25 词指令,无需模型调用)。

实测节省:臃肿的编程会话约降 57-64%,HTML dump 约 83%;但干净的短会话节省为 0——它只去除冗余,不制造虚假节省。另附 4/8/16GB 显存预设和高上下文 dense/MoE 容量表(如 128k MoE 行压缩后有效容量约 898k)。作者征求反馈与贡献者。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →