Zoom 研究:176 组对照实验拆解编码 harness 各组件的真实贡献
dair_ai · x · 2026-09-19
Zoom 团队与合作者发布了一项系统性的编码 harness 消融研究:固定执行循环,逐一改变规划、动作空间与上下文管理,在 176 组匹配设置、四个模型、SWE-Bench Verified 与 Terminal-Bench 2.1 上测试。
关键发现:
- 上下文管理在上下文窗口越紧张时收益越大;其收益主要来自防止溢出失败,而非提升推理质量
- 五种策略中,先做规则式删减(elision)再做 LLM 摘要,性价比最高
- 让被删减内容可恢复会增加机制复杂度,但模型很少使用,准确率无提升
- 规划的作用随模型强弱而变:对最弱模型能提升成功率,对更强模型准确率几乎不动
对自建 coding harness 的维护者有直接参考价值。
所属事件:Zoom 实证研究拆解编码 Agent Harness 组件贡献(7 条相关)→
「编程与Agent」频道最新
- TypeSafe 公开 Jev 1.13 九大失败模式及规避清单 — hackgoofer · 2026-09-19
- 开发者吐槽 AI 编码助手:要三行修复,给 400 行代码加 17 个测试 — burny_tech · 2026-09-19
- 用 Pace Layers 解读 AI 焦虑:慢层被资本逼着快跑 — dbreunig · 2026-09-19
- Muse 开放连接器平台:开发者 API 可接入个人 AI 助手 — alexandr_wang · 2026-09-19
- AWS 把 DRAM 当Agent稀缺资源:AgentCore 运行时按需驻留、超售降本 — bookwormengr · 2026-09-19
- shadcn-labs 开源 pdfcn:React 组件一键生成精美 PDF — tom_doerr · 2026-09-19