Agent上下文压缩可降半数成本
appenz · x · 2026-07-14
这条讨论的是 agent 上下文压缩(compact):当 agent 因长时间不活动而产生 cache miss 时,先做一次压缩可以让 token 成本降低 50% 以上。
关键点:
- 他们用真实的 Fable 5 trace 做了模拟,发现如果把上下文维持在 128k–256k tokens,总体花费会从二次增长变成接近线性增长。
- 问题是:自我总结本身很慢,长 trace 上要 1–2 分钟。
- 为此团队训练了一个“极快”的压缩模型 Relace Compact,把 token-level classification 做到 50k tok/s,成本也低于 cache read。
- 成本大约是 $0.20 / million input 和 $0.20 / million output tokens。
- 他们已把它接入 Jacq,也提供文档供集成到其他产品里。
这条对做 agent 工作流、上下文管理和推理成本优化的人很有参考价值。
所属事件:Relace推出Compact模型,5秒极速压缩Agent上下文降本提速(3 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11