同模型不同 Harness:编程 Agent 性能受上下文策略影响巨大
rohanpaul_ai · x · 2026-08-31
研究对比了 Yuj 编程 Agent 在两种配置下的表现:对照组保留完整对话历史,实验组则压缩旧工具输出并检测卡顿行为。在 20k token 窗口的 SWE-bench Verified 任务上,Qwen2.5-Coder 的任务平均 F2PF 从 28% 升至 49%,完整解决方案从 43 个增至 72 个。这种改进在 262k token 的宽窗口下消失。研究表明,评估编程 Agent 应将模型、Harness、上下文策略等视为整体求解器。
所属事件:研究发现编程 Agent 性能高度依赖 Harness 上下文策略(2 条相关)→
「编程与Agent」频道最新
- Manzanas:让 Agent 实时控制跨 3 台 Mac 的 7 个 iOS 模拟器 — Plastic-Risk-6309 · 2026-08-31
- 工程师痛述:生产环境 AI 账单暴雷的血泪教训 — BasePsychological899 · 2026-08-31
- 多人共用仓库时如何避免 AI 编程会话冲突? — McButterblump · 2026-08-31
- 将 Google Drive 变为 ChatGPT 的外部项目记忆 — edalgomezn · 2026-08-31
- 真正的异步委托不需要展示繁琐的思考链 — manosaie · 2026-08-31
- Maven 开设企业级 AI Agent 构建实战课程 — hugobowne · 2026-08-31