同模型不同 Harness:编程 Agent 性能受上下文策略影响巨大

rohanpaul_ai · x · 2026-08-31

研究对比了 Yuj 编程 Agent 在两种配置下的表现:对照组保留完整对话历史,实验组则压缩旧工具输出并检测卡顿行为。在 20k token 窗口的 SWE-bench Verified 任务上,Qwen2.5-Coder 的任务平均 F2PF 从 28% 升至 49%,完整解决方案从 43 个增至 72 个。这种改进在 262k token 的宽窗口下消失。研究表明,评估编程 Agent 应将模型、Harness、上下文策略等视为整体求解器。

所属事件:研究发现编程 Agent 性能高度依赖 Harness 上下文策略(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →