176 组实验拆解 Coding Agent Harness:上下文管理弱模型时最关键
_akhaliq · x · 2026-09-19
新论文《An Empirical Study of Harness Design for Coding Agents》构建了一个模块化编码 harness,固定执行循环,只变动规划、工具接口与上下文管理三个组件,在 176 组实验设置中对四个模型于 SWE-Bench Verified 和 Terminal-Bench 2.1 上评测,拆解各组件贡献。
主要发现:
- 上下文管理在上下文窗口预算紧张时最重要:防止上下文溢出提前终止执行,让 agent 能走到代码修改与验证环节;窗口越大收益递减。
- LLM 摘要前的 staging elision 效率最高:在峰值上下文可控、减少摘要调用的同时保持接近的成功率。
- 规划的作用随模型能力变化:弱模型靠规划维持轨迹存活以尝试修改,提升成功率但增加成本;强模型上规划主要去除冗余的改后验证,降成本而准确率基本不变。
- 预定义工具帮 bash 弱模型,bash-only 接口对 bash 强模型更省成本。
所属事件:176 组实验拆解编码 Agent 框架,上下文管理最关键(3 条相关)→
「编程与Agent」频道最新
- mitsuhiko:认真试用 Web Components 后团队全线转投 React — mitsuhiko · 2026-09-19
- 实测:jev 在真机安卓 e2e 测试比 DeepSeek+视觉方案快约 14.8 倍 — kevinkern · 2026-09-19
- Claude Code 2.1.277 开始支持 AGENTS.md,无 CLAUDE.md 时自动读取 — romainhuet · 2026-09-19
- -render + jev 实验:毫秒级即时渲染的 Generative UI — cramforce · 2026-09-19
- 别照抄编码 Agent 架构:六步法设计知识型 Agent — MaryamMiradi · 2026-09-19
- Jeb 实战用法:给 prompt 分级、判断该拒绝还是该执行 — QuixiAI · 2026-09-19