上下文溢出致 78.7% 任务失败:Harness 设计实验拆解 Agent 成绩

alex_verem · x · 2026-09-25

同上篇论文的详细转述:研究者固定模型、只改 harness(决定模型如何规划、用什么工具、长任务里记什么),在 500 个 GitHub 真实问题和 89 个命令行任务上做 176 组实验。

内存/上下文管理影响最大:32k token 窗口且无内存管理时,四个模型平均 78.7% 的 GitHub 任务因上下文用尽而失败(Nemotron-3 550B 仅解出 6.4%);让 harness 裁剪旧工具输出、摘要早前步骤或两者并用后,同一模型成功率升至 51%–58%。

规划的作用取决于模型强弱:最小的 Nemotron-3 30B 无规划时中位数 5 轮即停,成功率从 25.2% 跌至 13.6%;两个更强模型有规划时精度变化不到 2 个点,但成本降约 30%(不再重复检查已完成工作)。

工具同理:550B 换成裸终端替代预定义文件工具后,解出更多任务且成本降 53%;Mistral Medium 3.5 则相反,从 68.6% 掉到 45.4%。

作者结论:没有单一最优配置,benchmark 分数衡量的是模型+harness 的整体,harness 决定了其中很大一部分。

所属事件:176 组对照实验系统量化 Agent Harness 设计影响(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →