开源工具 SlimToken:请求进模型前先压缩上下文,实测省 57-64% token
Intelligent-Key7357 · reddit · 2026-08-18
开发者发布 MIT 协议的开源 token 压缩器 SlimToken,在上下文送达模型前进行可逆压缩,以塞进更多内容并降低 token 开销。它基于 or/xxhash/tiktoken,token 计数使用真实的 cl100k 分词器而非估算。
三种运行方式:① Proxy 模式(默认)——常驻服务器挡在 Anthropic/OpenAI/Ollama 前,安装后自动接管 ANTHROPICBASEURL,所有请求自动压缩且可卸载还原;② MCP server——把流水线暴露为 8 个工具供 agent 按需调用;③ Agent Skill + CLI + Python 库,可用于 Claude Code / Codex / OpenCode。
压缩流水线包括:剔除 schema 中的注释/示例、折叠重复横幅与空白、去重重复的 toolresult、截断较早的 assistant 文本、硬性 token 预算、HTML DOM 剪枝、按类型压缩大型工具输出等。安全保证:代码块字节级保留、pair-safe 不会让 toolresult 与 tooluse 失配、未改动内容零拷贝返回。另有输出过滤(去掉 "Sure!" 类开场白、流式截断失控输出)和约 1ms 的纯 CPU 提示改写器(200 词啰嗦请求压成约 25 词指令,无需模型调用)。
实测节省:臃肿的编程会话约降 57-64%,HTML dump 约 83%;但干净的短会话节省为 0——它只去除冗余,不制造虚假节省。另附 4/8/16GB 显存预设和高上下文 dense/MoE 容量表(如 128k MoE 行压缩后有效容量约 898k)。作者征求反馈与贡献者。
「编程与Agent」频道最新
- MCP 服务器安全警示:只读 Hint 非安全边界 — WirelessLife · 2026-08-18
- Nous 发布 Hermes Agent 桌面版,支持跨平台记忆与自动化 — Teknium · 2026-08-18
- 用 MCP 构建代理社交媒体闭环:从策划到发布 — Steveo_altar2 · 2026-08-18
- AI 11 分钟完成 11 小时的逆向工程工作 — tetsuoai · 2026-08-18
- Qwen3.8 27B 跑赢大模型,Mac 本地实测惊艳 — appenz · 2026-08-18
- Hermes Desktop 推 Bot 模式,支持多智能体互通信 — NousResearch · 2026-08-18