176 组对照实验系统量化 Agent Harness 设计影响

UMass Amherst、Zoom、Emory 与 UNC Charlotte 研究者发布论文,在固定模型、只改动 harness(决定模型如何规划、用什么工具、长任务中记什么)的条件下,于 500 个真实 GitHub 问题和 89 个命令行任务上开展 176 组对照实验,系统量化了 harness 设计对 Agent 成绩的影响,并发现上下文溢出会导致 78.7% 的任务失败。

2026-09-25 ~ 2026-09-25 · 2 条相关