上下文溢出致 78.7% 任务失败:Harness 设计实验拆解 Agent 成绩
alex_verem · x · 2026-09-25
同上篇论文的详细转述:研究者固定模型、只改 harness(决定模型如何规划、用什么工具、长任务里记什么),在 500 个 GitHub 真实问题和 89 个命令行任务上做 176 组实验。
内存/上下文管理影响最大:32k token 窗口且无内存管理时,四个模型平均 78.7% 的 GitHub 任务因上下文用尽而失败(Nemotron-3 550B 仅解出 6.4%);让 harness 裁剪旧工具输出、摘要早前步骤或两者并用后,同一模型成功率升至 51%–58%。
规划的作用取决于模型强弱:最小的 Nemotron-3 30B 无规划时中位数 5 轮即停,成功率从 25.2% 跌至 13.6%;两个更强模型有规划时精度变化不到 2 个点,但成本降约 30%(不再重复检查已完成工作)。
工具同理:550B 换成裸终端替代预定义文件工具后,解出更多任务且成本降 53%;Mistral Medium 3.5 则相反,从 68.6% 掉到 45.4%。
作者结论:没有单一最优配置,benchmark 分数衡量的是模型+harness 的整体,harness 决定了其中很大一部分。
所属事件:176 组对照实验系统量化 Agent Harness 设计影响(2 条相关)→
「编程与Agent」频道最新
- 开发者称 Codex 已完全取代 Claude Code 成主力编程工具 — eptwts · 2026-09-25
- Weco 预印本:agent 八天自主改进自身软件七项,提升泛化到四个保留基准 — VraserX · 2026-09-25
- 让 Amp 把 Mac Mini 变成 Codex 远程电脑操控机,含完整 prompt 与 skill — iannuttall · 2026-09-25
- GitHub 安全实验室发布 AI 驱动 Fuzzing 流水线,一键自动挖 C/C++ 漏洞 — mboehme_ · 2026-09-25
- 基于 BrowserAct 模板改出可复用 Google Maps 客户线索抓取机器人 — alifcoder · 2026-09-25
- 独立开发者借新模型热度做主题皮肤,蹭 LLM 发布涨 MRR — marclou · 2026-09-25