AutoCompact 教智能体自己决定何时压缩上下文,SWE-bench 提升 9.2 分
omarsar0 · x · 2026-10-04
Elvis Saravia 指出一个新趋势:从 AutoHarness、AutoContext 到 AutoCompact,越来越多工作在训练模型原生支持原本由外部 harness 承担的能力。
AutoCompact 的做法
- 训练智能体自主决定:何时压缩上下文、保留哪些工作状态、如何恢复任务。
- 一个 judge 先审查基础智能体的压缩决策,在执行前替换有缺陷的决策;修正后的轨迹用于 SFT,再用任务成功率奖励做 RL,把编码与压缩能力联合训练。
效果
- SWE-bench Verified 通过率提升 9.2 分,SWE-PolyBench Verified 提升 5.0 分。
- 即使在 256K 上下文从不溢出的条件下收益依然成立,说明「学会压缩」并非仅在上下文不够时才有用。
作者还提到这与 Meta 新论文「训练模型原生管理上下文」思路相似,并追问这种方法的局限何在。
「编程与Agent」频道最新
- 知名博主:不支持 API/MCP 的应用我现在直接不注册 — nateliason · 2026-10-04
- 用 Agent 技能一周融资研究压缩成一次运行:自动排查冲突投资人 — MartinGTobias · 2026-10-04
- 用上万个并行 agent 同时开发多个应用,卡在协调难题上 — real_serviceloom · 2026-10-04
- 开发者做 AgentTerm 把终端 CLI 会话扩展成可视化工作区 — AIIDreamNoDrive · 2026-10-04
- 公司接入 MCP 服务器后,审计日志里 40 张变更单全算在服务账号头上 — MityFourDoor · 2026-10-04
- 观点:AI 时代应更多使用抽象,用 lint 规则约束 agent 决策空间 — mattpocockuk · 2026-10-04