长会话上下文压缩提速
dee_hw · x · 2026-07-15
这条转发讨论的是 长会话上下文压缩 的实际工程效果。
- 在长 session 里,Relace 的自动压缩只花了 5 秒,而原生 GPT 5.6 Sol 的 compaction 需要 1 分钟以上;作者还提到自己有时要等 7 分钟。
- 他们的思路是在长会话中自动做 compaction,让 agent 保持更短的上下文、减少等待。
- 被引文进一步解释了技术动机:在 cache miss 后压缩 agent context,可把 token 成本降低 50%+。
- 通过把上下文控制在 128k–256k tokens,开销会从随轮次呈二次增长,变成更接近线性。
- 代价是普通 self-summary 太慢,因此他们训练了一个更快的 compact model,声称可达到 50k tok/s,并且成本低于 cache read。
所属事件:Relace推出Compact模型,5秒极速压缩Agent上下文降本提速(3 条相关)→
「编程与Agent」频道最新
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11