176 组实验拆解 Coding Agent Harness:上下文管理弱模型时最关键

_akhaliq · x · 2026-09-19

新论文《An Empirical Study of Harness Design for Coding Agents》构建了一个模块化编码 harness,固定执行循环,只变动规划、工具接口与上下文管理三个组件,在 176 组实验设置中对四个模型于 SWE-Bench Verified 和 Terminal-Bench 2.1 上评测,拆解各组件贡献。

主要发现:

所属事件:176 组实验拆解编码 Agent 框架,上下文管理最关键(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →