研究发现编程 Agent 性能高度依赖 Harness 上下文策略

最新研究显示,在模型固定的情况下,控制模型视野、工具使用与工作流的 Harness 配置对编程 Agent 表现影响巨大。实验对比了保留完整对话历史与压缩旧工具输出并检测卡顿行为两种策略,在 20k token 窗口、SWE-bench Verified 基准下,优化 Harness 使 Qwen 模型解题数翻倍,表明上下文管理是提升 Agent 能力的关键因素。

2026-08-31 ~ 2026-08-31 · 2 条相关