176 组对照实验系统量化 Agent Harness 设计影响
UMass Amherst、Zoom、Emory 与 UNC Charlotte 研究者发布论文,在固定模型、只改动 harness(决定模型如何规划、用什么工具、长任务中记什么)的条件下,于 500 个真实 GitHub 问题和 89 个命令行任务上开展 176 组对照实验,系统量化了 harness 设计对 Agent 成绩的影响,并发现上下文溢出会导致 78.7% 的任务失败。
2026-09-25 ~ 2026-09-25 · 2 条相关
- 上下文溢出致 78.7% 任务失败:Harness 设计实验拆解 Agent 成绩 — alex_verem · 2026-09-25
- 176 组对照实验:Agent Harness 设计对成绩影响被系统量化 — alex_verem · 2026-09-25