Distil 用统计检验给智能体上下文压缩上了质量门禁
chandu1221 · reddit · 2026-07-26
Distil:给智能体做“有质量约束”的上下文压缩
这个项目做的是 LLM 智能体上下文压缩,但它不主张“压短了就算成功”,而是把压缩配置放到真实 agent 轨迹上做 配对非劣检验(TOST / McNemar)。作者的原则很明确:只要某种压缩会改变 agent 的工具调用或输出决策,就在发布前直接拒绝。
要点包括:
- 纯 stdlib,零运行时依赖,Python 3.9+ 直接可用
- 有一个可逆层,需要时能把压缩后的内容恢复成原始字节
- 可作为 Anthropic / OpenAI / Gemini 风格 API 的代理 使用
- 在 500 个 SWE-bench Verified 任务上,压缩版结果是 42.0%,全上下文是 39.2%;作者称这是“统计上不劣于全上下文”的 tie
作者还解释了为什么要做这个门控:早期版本过度摘要旧消息,单轮 token 看起来省了很多,但一跑真实 harness,端到端成功率就崩了。另一个教训是,改写对话前部会破坏 prefix cache,所以 Distil 采用“前缀保持字节稳定、尾部再压缩”的策略。
「编程与Agent」频道最新
- 一档播客把智能体 harness 讲到让工程师想重写一切 — hwchase17 · 2026-07-26
- 给 Claude 挂载 33 个工具:MCP Server 设计避坑指南 — SimpleSpacer97 · 2026-07-26
- 多 agent 工作流需要检查点、共享状态和断路器 — blaizedsouza · 2026-07-26
- LLM 不是好随机数源,低熵限制复杂 agent — austinvhuang · 2026-07-26
- 生产环境里的 agent 失败模式可归纳为六类 — blaizedsouza · 2026-07-26
- 生产环境里的 agent 应该默认保留人工检查点 — blaizedsouza · 2026-07-26