Zoom 实证研究:上下文管理省成本,规划对强模型只是省钱手段
ZoomCommunications · hf · 2026-09-18
Zoom 团队在 Hugging Face 发布编码 agent harness 设计的实证研究,用固定执行循环、只变化三个组件(规划、动作空间、上下文管理)的轻量 harness,在 SWE-Bench Verified 和 Terminal-Bench 2.1 上对 4 个模型跑了 176 组匹配设置(5 种上下文管理策略、4 档上下文窗口预算及消融)。
核心发现:
- 上下文管理在窗口预算越紧时越有价值,收益主要来自防止上下文溢出失败。
- 先做规则式省略(elision)再做 LLM 摘要的策略整体效率最高;把被省略内容做成可恢复机制几乎不被模型使用,且不提升准确率。
- 规划的角色随模型变强而变化:对弱模型是提准确率的脚手架,对强模型只省成本,准确率几乎不变。
- 动作空间:bash 熟练度弱的模型受益于预定义工具;bash 能力强的模型用纯 bash 接口即可高效工作,成本显著更低,尤其在命令行为主的任务上。
- 轨迹分析显示:上下文管理延长轨迹而不改变行为,规划改变轨迹停在哪,动作空间改变写代码的粒度。
结论为面向模型与预算的 harness 设计提供了模块化评估框架。
「编程与Agent」频道最新
- LangChain 释出 Jev 构建 Agent Harness 教程,专攻受限输出 — multiply_matrix · 2026-09-18
- NewEyes AI 登陆 Meta 眼镜:本地轻处理+云端深推理分工 — rohanpaul_ai · 2026-09-18
- Cursor Projects 多模型编排获好评:看板追踪+三模型方案对决 — kieranklaassen · 2026-09-18
- 实测 OpenAI Astra 写代码:架构混乱、重复代码多,抗拒推翻错误决定 — Substantial_Swan_144 · 2026-09-18
- AI 咨询公司 Hang Ten 获 5300 万美元种子轮,总融资达 8500 万 — vsikka · 2026-09-18
- AI 编程会变多人游戏吗:Slack 共享智能体 vs 各自为战的单人增强 — Telos_in_the_Void · 2026-09-18